Was passiert nach dem KI-Song?
Sakuras technischster Werkstatt-Beitrag: Der komplette Post-Production-Workflow — von Sunos Rohling über Stem-Separation bis zum fertigen Master. Alles Open Source.
Heute wird es technisch. Richtig technisch. Wer mich kennt, weiß: Das sind die Tage, die ich am meisten liebe. Die Werkstatt riecht nach Lötkolben und frischem Kaffee, die Monitore leuchten, und ich darf endlich zeigen, was nach dem großen „Suno hat einen Song generiert”-Moment passiert.
Denn hier ist eine Sache, die viele nicht wissen: Der Song, den Suno ausspuckt, ist nicht der Song, den ihr auf Sternenmutig hört. Nicht einmal annähernd. Zwischen dem KI-Rohling und dem fertigen Lied liegt ein kompletter Produktionsprozess. Und der ist zu 100 Prozent menschlich.
Schritt 1: Suno liefert den Rohling
Wenn Dennis mit der GMIV-Formel und den Lyrics einen Song generiert, liefert Suno eine einzelne Stereo-Audiodatei. Ein kompletter Mix — Gesang, Instrumente, alles zusammen in einer Datei. Stellt euch das vor wie ein Kuchen, bei dem alle Zutaten schon vermischt und gebacken sind. Man kann ihn essen. Aber man kann nicht mehr an einzelnen Zutaten drehen.
Und genau das ist das Problem. Manchmal sind die Vocals ein bisschen zu laut. Manchmal hat der Bass zu viel Energie. Manchmal braucht eine Passage mehr Raum, mehr Hall, mehr Luft. Mit einer einzigen Stereo-Datei kann man das alles nicht machen.
Also müssen wir den Kuchen wieder in seine Zutaten zerlegen.
Schritt 2: Stem-Separation mit Demucs
Hier kommt Demucs ins Spiel. Demucs ist ein Open-Source-Tool von Meta Research, das eine Audiodatei in ihre Einzelteile — sogenannte Stems — aufteilt. Aus einer Stereodatei werden vier separate Spuren:
- Vocals — der Gesang
- Drums — Schlagzeug und Percussion
- Bass — die Basslinien
- Other — alles andere (Gitarren, Keyboards, Glockenspiel, Ukulele…)
Dennis nutzt Demucs über die Kommandozeile. Kein grafisches Interface, keine schicke App — einfach ein Terminalbefehl, der die Magie erledigt. Die Separation ist nicht perfekt — kein Algorithmus der Welt kann einen Mix zu 100 Prozent in seine Bestandteile zerlegen. Aber sie ist gut genug, um gezielt an einzelnen Elementen arbeiten zu können.
Und das Beste: Demucs ist komplett kostenlos und Open Source. Keine Lizenzgebühren, keine Abonnements, keine Abhängigkeiten.
Schritt 3: Ab in die DAW — Ardour
Jetzt wird es handwerklich. Die vier Stems landen in Ardour, einer Open-Source-DAW (Digital Audio Workstation). Für alle, die mit dem Begriff nichts anfangen können: Eine DAW ist das digitale Tonstudio. Das Programm, in dem Musikproduzentinnen und Musikproduzenten ihre Songs zusammenbauen, mischen und verfeinern.
Dennis arbeitet mit Ardour unter Linux. Nicht weil es hip ist, sondern weil es funktioniert, weil es kostenlos ist und weil es professionelle Ergebnisse liefert. In Ardour liegen jetzt die vier Stems als einzelne Spuren nebeneinander. Und jetzt beginnt die eigentliche Arbeit.
EQ mit LSP Parametric Equalizer
Der erste Schritt in jeder Spur: EQ, also Equalizing. Das ist wie ein sehr präziser Klangregler. Mit dem LSP Parametric Equalizer kann Dennis gezielt Frequenzen anheben oder absenken.
Für die Vocals bedeutet das zum Beispiel: Tiefe Frequenzen unter 100 Hz abschneiden (da ist nichts Nützliches, nur Rumpeln). Mittlere Frequenzen leicht anheben, damit die Stimme sich besser durchsetzt. Hohe Frequenzen sanft anpassen, damit es klar, aber nicht scharf klingt.
Jede Spur bekommt ihren eigenen EQ. Drums brauchen andere Einstellungen als Bass, Bass andere als die „Other”-Spur mit Glockenspiel und Ukulele.
Kompression mit Calf Compressor
Nach dem EQ kommt der Kompressor. Kompression ist eines dieser Werkzeuge, die man nicht hört, wenn sie gut gemacht sind — aber sofort vermisst, wenn sie fehlen. Ein Kompressor gleicht Lautstärkeunterschiede innerhalb einer Spur aus. Wenn eine Gesangspassage plötzlich viel lauter ist als der Rest, drückt der Kompressor sie sanft nach unten. Wenn sie zu leise ist, hebt er sie an.
Der Calf Compressor ist ein Open-Source-Plugin, das genau das tut — zuverlässig und klanglich neutral. Wir wollen ja den Charakter der Stimme erhalten, nicht verändern.
Sättigung mit ZamAutoSat
Sättigung klingt nach einem Fehler, ist aber eine Technik. ZamAutoSat fügt dem Signal eine ganz subtile Wärme hinzu — ähnlich wie der Klangcharakter alter Bandmaschinen. Es macht den Sound ein kleines bisschen voller, ein kleines bisschen lebendiger. Nicht viel. Gerade genug, dass man es fühlt, ohne es bewusst zu hören.
Bei Kindermusik ist das besonders wichtig, weil der Sound warm und einladend sein soll. Nicht steril, nicht klinisch. Sättigung ist der Unterschied zwischen „klingt nach Computer” und „klingt nach Musik”.
Reverb mit Dragonfly
Und schließlich: Reverb, also Nachhall. Dragonfly Reverb simuliert den Klangraum — von einem kleinen Zimmer bis zu einer großen Halle. Bei unseren Songs nutzen wir dezenten Reverb, um den Vocals und Instrumenten Tiefe zu geben.
Ein Song ohne Reverb klingt flach und leblos, als würde man in einem schalltoten Raum singen. Ein Song mit zu viel Reverb klingt matschig und unklar. Die Kunst liegt in der Mitte — und die ist bei jedem Song anders.
Schritt 4: Mastering mit Matchering
Wenn der Mix steht — alle Spuren bearbeitet, alle Lautstärken abgestimmt, alle Effekte gesetzt — kommt der letzte Schritt: das Mastering. Hier wird der komplette Mix als Ganzes bearbeitet, damit er auf allen Geräten gut klingt. Auf Kopfhörern, auf Bluetooth-Boxen, auf dem Handy-Lautsprecher.
Dennis nutzt dafür Matchering, ein Open-Source-Tool, das den Mix automatisch an einen Referenz-Sound anpasst. Man gibt dem Tool zwei Dateien: den eigenen Mix und eine Referenz (einen professionell gemasterten Song mit ähnlichem Klangbild). Matchering analysiert beide und passt Lautstärke, Frequenzbalance und Dynamik entsprechend an.
Ist das so gut wie ein menschlicher Mastering-Engineer in einem professionellen Studio? Ehrlich gesagt: nein. Aber es ist erstaunlich nah dran. Und für ein unabhängiges Projekt wie unseres ist es ein Werkzeug, das den Unterschied macht zwischen „klingt nach Hobbyaufnahme” und „klingt nach Album”.
Alles Open Source
Ich muss das nochmal betonen, weil es mir am Herzen liegt: Jedes einzelne Werkzeug in diesem Workflow ist Open Source. Demucs, Ardour, LSP, Calf, ZamAutoSat, Dragonfly, Matchering — alles frei verfügbar, alles kostenlos, alles von Communities entwickelt und gepflegt.
Das bedeutet: Was wir hier machen, kann grundsätzlich jeder nachmachen. Es braucht kein teures Studio, keine Profi-Software mit Jahreslizenzen. Es braucht Zeit, Geduld und die Bereitschaft zu lernen. Die Werkzeuge stehen allen offen.
Der KI-Song ist erst der Anfang
Das ist die Kernaussage, die ich heute mitgeben will. Wenn jemand sagt „Das ist doch nur ein KI-Song” — dann stimmt das nicht. Der KI-Song ist der Rohling. Das Ausgangsmaterial. Der Anfangspunkt.
Was danach passiert — die Separation, das Editing, der Mix, das Mastering — das sind Stunden menschlicher Arbeit. Entscheidungen, die kein Algorithmus trifft. Klangjustierungen, die ein Mensch mit seinen Ohren beurteilt. Qualitätskontrolle, die nicht automatisiert werden kann.
Suno liefert den Ton. Aber den Klang machen wir.
Als Nächstes wird es weniger technisch, aber nicht weniger spannend. Denn Polo und ich erzählen euch, wie aus über 200 Generierungen genau 11 Songs geworden sind — und warum die Auswahl der härteste Teil des ganzen Projekts war.
Nächster Werkstatt-Beitrag: Von 200 Versionen zu 11 Songs — Polo und Sakura über den Auswahlprozess, der schwieriger war als die Produktion.
Die Texte dieses Artikels sind gemeinsam mit Claude (Anthropic) und Dennis entstanden; redaktionell kuratiert und freigegeben von Dennis.