Die GMIV-Formel: Unser Rezept für gute Prompts
Sakura öffnet die Werkstatt und zeigt, wie die GMIV-Formel funktioniert — mit echten Prompts, konkreten Beispielen und dem Unterschied zwischen gut und schlecht.
Hallo, ich bin Sakura! Seehund, E-Gitarristin und diejenige im Team, die am liebsten an Knöpfen dreht, Regler schiebt und herausfindet, wie Dinge funktionieren. Heute nehme ich euch mit in die Werkstatt — und zwar ganz tief hinein. Denn heute geht es um die Frage, die den Unterschied zwischen einem guten und einem schlechten KI-Song ausmacht: Wie sagt man einer KI eigentlich, was sie machen soll?
Die Antwort ist unsere GMIV-Formel. Und ja, der Name klingt ein bisschen wie eine Vitaminzusammensetzung. Aber glaubt mir: Wenn ihr sie einmal verstanden habt, werdet ihr nie wieder einen Prompt schreiben wollen, ohne sie zu benutzen.
Was ist die GMIV-Formel?
GMIV steht für fünf Bausteine, aus denen jeder unserer Style-Prompts zusammengesetzt ist:
- G — Genre (z.B. children’s pop, lullaby, kids’ rock)
- M — Mood (z.B. brave and uplifting, calm and dreamy, playful and silly)
- I — Instrumentation (z.B. glockenspiel + ukulele + claps)
- V — Vocal Style (z.B. warm child vocal, soft female lullaby voice)
- BPM — Tempo (z.B. 120 BPM)
Das war’s. Fünf Bausteine, zusammengesetzt zu maximal 20 Wörtern. Klingt simpel? Ist es auch. Aber der Weg dahin war alles andere als simpel.
Ein echter Prompt aus der Praxis
Nehmen wir „Mut ist ein Superlicht”, den Eröffnungssong von Sternenmutig. Kenzos großer Auftritt. Der Style-Prompt dafür sieht so aus:
children's pop, brave and uplifting, glockenspiel + ukulele + claps, warm child vocal, 120 BPM
Zählt mal die Wörter: 14. Unter unserer Grenze von 20. Und trotzdem steckt alles drin, was Suno wissen muss:
- Genre: children’s pop — damit die KI im richtigen musikalischen Universum landet
- Mood: brave and uplifting — damit der Song mutig und erhebend klingt, nicht traurig oder aggressiv
- Instrumentation: glockenspiel + ukulele + claps — das gibt dem Song seine akustische Identität. Das Glockenspiel ist besonders wichtig, weil es unser „Mut-Licht”-Motiv trägt
- Vocal Style: warm child vocal — eine warme, kindliche Stimme, die zu Kenzo passt
- BPM: 120 — ein mittleres Tempo, das Energie hat, aber nicht hetzt
Warum maximal 20 Wörter?
Jetzt fragt ihr euch vielleicht: Warum so kurz? Könnte man nicht mehr Details reinpacken?
Die ehrliche Antwort: Nein. Und das ist eine der wichtigsten Lektionen, die wir gelernt haben. Suno verarbeitet Style-Prompts anders als ihr einen Roman lest. Zu viele Wörter verwirren das Modell. Die Anweisungen fangen an, sich gegenseitig zu widersprechen oder zu verwässern. Ein Prompt mit 40 Wörtern klingt nicht doppelt so gut wie einer mit 20 — er klingt meistens schlechter.
Stellt euch vor, ihr bestellt in einem Restaurant: „Ich hätte gerne Pasta mit Tomatensoße, aber auch ein bisschen Sahne, und vielleicht Basilikum, aber nicht zu viel, und eigentlich mag ich auch Chili, und was ist mit Oliven?” Am Ende bekommt ihr irgendetwas, das nach nichts Bestimmtem schmeckt.
Besser: „Pasta, Tomatensoße, frischer Basilikum.” Klar, präzise, lecker.
Guter Prompt vs. schlechter Prompt
Damit ihr den Unterschied wirklich seht, hier ein direkter Vergleich:
Schlechter Prompt:
A fun happy song for kids with lots of instruments and a nice voice that children like, something catchy and not too loud, maybe with some piano and drums
Was ist hier falsch? Praktisch alles. „Fun happy” ist vage. „Lots of instruments” sagt der KI gar nichts Konkretes. „A nice voice” — welche Art von Stimme? „Maybe” — Unsicherheit im Prompt ist Gift. Und mit 30+ Wörtern ist er viel zu lang.
Guter Prompt:
children's pop, playful and bouncy, toy piano + hand drums + finger snaps, bright child vocal, 120 BPM
Hier weiß die KI genau, was sie tun soll. Jedes Wort hat eine Funktion. Kein Füllmaterial, keine Unsicherheit.
Warum wir BPM angeben
Das Tempo explizit anzugeben, klingt nach einem Detail. Aber es macht einen riesigen Unterschied. Ohne BPM-Angabe entscheidet Suno selbst, wie schnell der Song wird. Und diese Entscheidung passt nicht immer zum Rest.
„Sternenzauber-Schlaflied” braucht 72 BPM — langsam, beruhigend, zum Einschlafen. „Spring!” braucht 130 BPM — schnell, energiegeladen, zum Hüpfen. Wenn die KI selbst entscheidet, landet sie oft irgendwo in der Mitte. Und ein Schlaflied bei 110 BPM ist kein Schlaflied.
Die geheime Zutat: Negative Tags
Neben dem Style-Prompt gibt es noch ein zweites Feld, das mindestens genauso wichtig ist: die Negative Tags. Das sind Anweisungen, die der KI sagen, was sie nicht tun soll. Bei uns sieht das typischerweise so aus:
no autotune, no heavy bass, no distortion, no rap, no screaming
Warum ist das wichtig? Weil Suno manchmal kreativ wird auf eine Art, die nicht zu Kindermusik passt. Ein bisschen Autotune hier, ein verzerrter Bass dort — technisch interessant, aber nicht das, was wir für Zwei- bis Fünfjährige wollen.
Die Negative Tags sind wie die Leitplanken auf einer Straße. Sie lassen der KI genug Raum zum Fahren, verhindern aber, dass sie in den Graben fährt.
Das Zusammenspiel
Die GMIV-Formel funktioniert nicht isoliert. Sie ist Teil eines größeren Systems: Der Style-Prompt definiert den Klang. Die Lyrics definieren die Struktur (mit Bracket-Notation für Strophen, Refrain und Co.). Die Negative Tags setzen Grenzen. Und die BPM geben das Tempo vor.
Erst wenn alle vier Ebenen zusammenpassen, entsteht ein Song, der so klingt, als hätte jemand ihn gewollt — und nicht, als hätte eine Maschine gewürfelt.
Fazit: Weniger ist mehr
Die GMIV-Formel ist kein Zaubertrick. Sie ist das Ergebnis von Wochen des Ausprobierens, des Scheiterns und des Lernens. Hunderte Generierungen, in denen wir herausgefunden haben, was funktioniert und was nicht.
Die wichtigste Erkenntnis: Klarheit schlägt Komplexität. Ein kurzer, präziser Prompt mit den richtigen fünf Bausteinen erzeugt bessere Ergebnisse als ein langer, vager Text voller Wünsche und Hoffentlichs.
Das gilt übrigens nicht nur für Musik-KI. Es gilt für praktisch jede Interaktion mit KI-Systemen. Aber das nur am Rande — ich bin ja Musikerin, keine Prompting-Professorin.
In der Werkstatt wird es immer konkreter. Und nächstes Mal wird es persönlich: Denn ich muss euch von dem Tag erzählen, an dem alles gleich klang. Und warum das fast das Ende von Sternenmutig gewesen wäre.
Nächster Werkstatt-Beitrag: Was passiert, wenn man es falsch macht — und warum plötzlich alle Lieder gleich klangen.
Die Texte dieses Artikels sind gemeinsam mit Claude (Anthropic) und Dennis entstanden; redaktionell kuratiert und freigegeben von Dennis.