Google Lyria 3 Pro Testbericht (2026): Klangqualität, Sprachbefehle, Preis und API

Google Lyria 3 Pro Testbericht (2026): Preis, Eingabeaufforderungen und API

18 bezahlte Generationen · August 2026

Starke, voll ausgearbeitete Songs. Echte Variation in der Spielweise.

18/18Aufgaben erfolgreich abgeschlossen
55,5 smediane Generationszeit
$0.08pro getesteter Anfrage
17/18innerhalb von 5 Sekunden nach Erreichen des Ziels

Nach 18 bezahlten Generationen ergab unser Test des Google Lyria 3 Pro, dass das Modell einen kompletten Song mit Gesang, Text, Strophen, Refrains, Brücken und einem fast dreiminütigen Arrangement generieren kann. Es ist zudem weniger deterministisch, als die ausgefeilten Demos vermuten lassen. Jede Aufgabe wurde erfolgreich ausgeführt und jede Ausgabe lag als Stereo-MP3 mit 44,1 kHz und 192 kbps vor, doch bei wiederholten Eingabeaufforderungen ging ein Synth-Solo verloren, der genaue Liedtext wurde verändert, das Modell driftete in den falschen Stil ab und ignorierte die Vorgaben “kein Gesang” und “keine Riser”.

Das kurze Fazit: Lyria 3 Pro ist ein leistungsstarker Generator für komplette Songs, mit dem Nutzer mehrere Varianten erstellen und die beste davon auswählen können. Es handelt sich nicht um ein Ein-Klick-Tool für exakte Songtexte, exaktes Timing der Abschnitte oder strenge negative Einschränkungen. Bei $0,08 pro API-Anfrage für einen vollständigen Song über die Gemini-API ist dieser Auswahl-Workflow zwar erschwinglich, erfordert aber dennoch eine Qualitätssicherung durch Anhören und Bearbeitung.

Status des Lyria 3 Pro im Jahr 2026: Das Pro-Modell ist nicht das neueste Lyria-Modell

Stand: 10. August 2026, Google DeepMind beschreibt Lyria 3.5 als sein neuestes Modell der Musik-Generation und bewirbt es über Flow Music. Das bedeutet jedoch nicht, dass das Lyria 3 Pro damit überflüssig wird.

Die Aktuelle Modellseite zu Google Cloud Lyria 3 listet immer noch auf Vorschau auf Lyria 3 Pro unter der Modell-ID lyria-3-pro-Vorschau, mit der Generierung kompletter Songs, vom Nutzer bereitgestellten Songtexten, der Eingabe von Bildern zur Musikerstellung, Steuerungsmöglichkeiten für die Songstruktur und Clips mit einer Länge von bis zu 184 Sekunden.

Die Bezeichnung ist wichtig, da sich die Benutzeroberflächen unterscheiden. Verwenden Sie Lyria 3.5, wenn Sie ausdrücklich das neueste Flow Music-Erlebnis nutzen möchten. Verwenden Sie „Lyria 3 Pro Preview“, wenn Sie die dokumentierte Gemini-Interactions-API oder die Google-Cloud-Modellroute benötigen. Diese Rezension befasst sich mit diesem Pro-Workflow, wobei zur Erzeugung der 18 Beispiele eine separate Broly-Anywhere-Testroute verwendet wurde.

Google DeepMind-Seite, auf der Lyria 3.5 als neuestes Modell zur Musikgenerierung vorgestellt wird
Google DeepMind bezeichnet „Lyria 3.5“ als sein neuestes Modell zur Musikgenerierung. Stand: 10. August 2026.

Kurzfazit: Ist das Google Lyria 3 Pro gut?

Ja – sofern man es eher als Generator mit großem Spielraum denn als deterministischen Musik-Renderer betrachtet. Die stärksten Ergebnisse zeichneten sich durch stimmige Songbögen, überzeugende Instrumentenkombinationen, klare Ausklingphasen und genügend Struktur aus, um den Eindruck einer Komposition statt einer Endlosschleife zu vermitteln. Besonders nützlich war der Langzeittest: Beide 180-Sekunden-Anfragen lieferten zusammenhängende Titel mit einer Dauer von 176,170 bzw. 177,006 Sekunden.

Die Schwächen zeigten sich bei der Wiederholbarkeit. Eine identische Instrumentalanweisung führte zunächst zu einem zurückhaltenden Science-Fiction-Motiv, dann zu einem klassischen Kammermusikstück für Streicher, in dem mehrere der gewünschten Instrumente fehlten. Der genaue Liedtext funktionierte einmal einwandfrei, änderte sich jedoch bei zwei weiteren Wiederholungen. Wenn Ihre Veröffentlichung davon abhängt, dass eine bestimmte Zeile, ein Solo oder ein verbotenes Element niemals auftaucht, sollten Sie Alternativen vorbereiten und jede Ausgabe überprüfen.

Am besten fürWeniger geeignet für
Vollständige Songs mit einem klaren Genre und einem emotionalen SpannungsbogenExakte Wiedergabe des Liedtextes in einem Durchgang
Ausführliche Instrumentalstücke und filmische SteigerungenFrame-genaues Schnitt-Timing ohne DAW-Überprüfung
Entwicklung mehrsprachiger GesangsideenHarte negative Nebenbedingungen
Entwickler, die einen einfachen API-Preis pro Titel wünschenBenutzer, die eine deterministische Regeneration benötigen

Für einen umfassenderen Kategorievergleich bietet die bestehende ElevenLabs vs. Lyria 3 Pro vs. Mureka – Musiktest zeigt, warum Lyria am besten geeignet ist, wenn die gesamte musikalische Struktur wichtiger ist als die reine Stimmsteuerung.

Was ist Lyria 3 Pro?

Lyria 3 Pro ist Googles Modell zur Generierung vollständiger Songs aus der Lyria-3-API-Familie. Google hat am 25. März 2026 das Lyria 3 Pro vorgestellt., wodurch es sich für Titel mit einer Länge von bis zu drei Minuten eignet und die Steuerung von Intros, Strophen, Refrains, Brücken, Texten, Tempo und Instrumentierung ermöglicht. Das kleinere Modell „Lyria 3 Clip“ ist auf feste 30-Sekunden-Ausgaben ausgelegt, während „Pro“ das Modell für vollständige Arrangements ist.

Die Aktuelle Anleitung zur Musikgenerierung mit Gemini Laut dieser Angabe unterstützen beide Lyria-3-Modelle Text und Bilder und geben Stereo-Audio mit 44,1 kHz wieder.

Die Anleitung zur Eingabeaufforderung von Google Cloud Lyria unterstützt eine breitere Palette von Cloud-basierten Eingabedaten, darunter PDF-Dateien und bis zu 10 Referenzbilder. Da es sich hierbei um plattformspezifische Funktionen handelt, sollten Sie nicht davon ausgehen, dass jeder Eingabetyp über jeden Drittanbieter-Kanal funktioniert.

Google kündigt an, dass Lyria 3 Pro Titel mit einer Länge von bis zu drei Minuten und struktureller Steuerung erstellt
Google beschreibt Titel mit einer Länge von bis zu drei Minuten und die Möglichkeit, Intros, Strophen, Refrains und Brücken zu steuern.

So haben wir das Lyria 3 Pro getestet

Im praktischen Test wurde der Endpunkt der Broly Anywhere Tasks-API mit der Modell-ID verwendet lyria-3-pro. Dies war der vom Nutzer autorisierte Testort, nicht die offizielle Gemini-Benutzeroberfläche für Endverbraucher. Wir führten 18 Aufgaben durch, die folgende Bereiche abdeckten: Wiederholbarkeit bei identischen Eingabeaufforderungen, benutzerdefinierte Liedtexte, zeitliche Struktur, Klangtreue der Instrumente, Kohärenz bei Langform-Texten, Steuerung von BPM, Tonart und Instrumenten, spanische und japanische Gesangstexte sowie API-Artefakte.

Die Evidenz besteht aus drei Ebenen. Die Datei- und API-Daten – Dauer, MP3-Format, Abtastrate, Bitrate, Kanäle, Bearbeitungszeit und gemeldete Kosten – stammen direkt aus den Antworten und den heruntergeladenen Audiodateien. Ein „Gemini 3.6 Flash Audio Pass“ lieferte die unten verwendeten Hörbeschreibungen und die nach bestem Wissen erstellten Liedtext-Transkriptionen. Es handelt sich um eine modellgestützte Hörbewertung, nicht um eine Bewertung durch ein menschliches Panel oder einen menschlichen MOS. Genaue Angaben zu BPM, Tonart und Zeitstempeln der Abschnitte werden als vorläufig behandelt, sofern sie nicht unabhängig in einer DAW gemessen wurden.

TestkennzahlMessergebnis
Erfolgreich abgeschlossene Aufgaben18/18
Gesamtlänge des erzeugten Audios1.858,195 Sekunden
DateiübermittlungMP3, 44,1 kHz, 192 kbit/s, Stereo auf 18/18
Generierungszeit46–75 Sekunden; Medianwert: 55,5 Sekunden
Angegebene Veranstaltungskosten$0,08 pro Aufgabe; insgesamt $1,44
Genauigkeit der Dauer17/18 innerhalb von fünf Sekunden nach dem Ziel
Mittlerer absoluter Dauerfehler2,913 Sekunden

Zwei Netzwerkzugriffe schlugen fehl, nachdem die Aufgaben bereits erstellt worden waren. Der Runner setzte die Ausführung dieser bestehenden Aufgaben-IDs fort, anstatt sie erneut einzureichen, sodass die Menge weiterhin 18 eindeutige Aufgaben und 18 eindeutige Ergebnisse enthielt.

Lyria 3 Pro – Hands-on-Bewertungsbogen mit Angaben zu 18 erfolgreichen API-Generationen, Audio-Spezifikationen, Geschwindigkeit, Kosten, Zeitgenauigkeit und Steuerungsfehlern
Achtzehn Lyria-3-Pro-Aufgaben wurden am Teststandort erfolgreich durchgeführt; objektive Datei- und API-Daten werden von modellgestützten Beobachtungen getrennt.

Lyria 3 Pro – Klangqualität: ausgefeilter Klang, ungleichmäßige Steuerung

Allgemeine Musikalität und Abmischung

In der Hörbewertung wurden die stärksten Beiträge durchweg als ausgefeilt, stimmig und gut abgemischt beschrieben. Die Synth-Pop-Wiederholungen von T01 behielten die hellen Arpeggio-Synths, das elektronische Schlagzeug, die Gitarrenakzente, die weibliche Leadstimme und den hoffnungsvollen Ton bei. Die beiden Post-Rock-Tracks von T05 behielten einen erkennbaren, lang anhaltenden Aufbau bei, anstatt in einen offensichtlichen kurzen Loop zu verfallen.

Das bedeutet jedoch nicht, dass alle gewünschten Details erhalten geblieben sind. Bei T01-R1 wurde der gewünschte Synth-Lead in das Outro integriert, anstatt ein eigenständiges Solo zu erstellen, während bei T01-R3 das Solo weggelassen wurde und bei den höheren Tönen subtile Artefakte der Stimm-Synthese zu hören waren. T01-R2 entsprach am ehesten den Vorgaben.

T01-R2 – der stärkste Synth-Pop-Hit
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.

Genaue Liedtexte: möglich, aber nicht zwangsläufig

Der Test mit den benutzerdefinierten Liedtexten ist der eindeutigste Grund dafür, mehrere Aufnahmen zu erstellen. Bei T02-R1 wurde der größte Teil der letzten Zeile der Bridge ausgelassen. Bei T02-R2 wurden nach dem Refrain Echo-Wiederholungen hinzugefügt. Bei T02-R3 wurde der bereitgestellte Liedtext in der „Best-Effort“-Transkription exakt befolgt.

Das macht diese Funktion zwar nützlich, verändert aber den Arbeitsablauf. Genehmigen Sie einen Song nicht, nur weil die erste Strophe korrekt ist. Vergleichen Sie den kompletten Gesang mit dem Quelltext, einschließlich der wiederholten Refrains und der letzten Zeile, bevor Sie mit dem Abmischen oder der Veröffentlichung fortfahren.

T02-R1 – Beispiel für eine Auslassung im Liedtext
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.
T02-R3 – Kandidat für „exact-lyrics“
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.

Aufbau und zeitlich begrenzte Abschnitte

Alle drei 120-Sekunden-Stücke im cineastisch-elektronischen Stil wurden so beschrieben, dass sie der gewünschten Makro-Reihenfolge folgten: gefiltertes Intro, erster Vers, ausladender Refrain, Cello-/Granular-Break, kräftigerer zweiter Vers, abschließender Refrain und Zwei-Akkord-Ausklang. Die tatsächlichen Dateien waren zwischen 115,148 und 117,029 Sekunden lang, sodass keine das angestrebte Ziel von 120 Sekunden erreichte.

In einigen Durchläufen erzeugte der Auswerter zudem unmögliche Zeitstempel, die über die tatsächliche Dateidauer hinausgingen. Die aussagekräftige Schlussfolgerung ist daher begrenzt: Lyria 3 Pro hat die angeforderte Sequenz verarbeitet, doch dieser Test belegt nicht, dass die Platzierung der Abschnitte frame-genau erfolgt. Verwende eine DAW, wenn ein Refrain genau an einer bestimmten Schnittstelle platziert werden muss.

Messgenauigkeit und der größte Fehler bei der Wiederholbarkeit

T04-R1 lieferte den beabsichtigten Science-Fiction-Suspense-Sound mit einem Cello-Ostinato, einem Drone, einer glasartigen Klangtextur, einem kontrollierten Höhepunkt und einem offenen Ende. T04-R2 verwendete dieselbe Vorgabe, tendierte jedoch eher zu klassischen Kammerstreichern. Es fehlten die gedämpften Klavierimpulse, der analoge Drone und die Glasharmonien.

T04-R1 – ein Instrumentalkandidat, der der Eingabe treu bleibt
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.
T04-R2 – Beispiel für eine stilistische Abweichung bei Instrumenten
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.

Dieses Paar ist nützlicher als eine einzelne perfekte Demo, da es das tatsächliche Produktionsrisiko verdeutlicht. Eine detaillierte Vorgabe verbessert die Erfolgsaussichten, legt das Arrangement jedoch nicht fest. Erstellen Sie mindestens zwei Varianten, wenn die Instrumentenzuordnung eine Rolle spielt.

Kohärenz bei Langtexten

Beide dreiminütigen Post-Rock-Anfragen blieben über den gesamten Verlauf hinweg in sich schlüssig. T05-R1 erreichte eine Dauer von 176,170 Sekunden und T05-R2 eine Dauer von 177,006 Sekunden, bevor sie zur anfänglichen Gitarrenmelodie zurückkehrten. In keinem der beiden Hörberichte wurde ein abrupter Genrewechsel oder ein abgeschnittenes Ende vermerkt.

T05-R1 – Beispiel für einen Post-Rock-Titel in Langform
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.

Hier macht Pro seinem Namen alle Ehre. Der „Lyria 3 Clip“ eignet sich für einen Loop oder eine kurze Vorschau; „Lyria 3 Pro“ kann ein Arrangement lange genug aufrechterhalten, um einen echten Song-Entwurf, einen Trailer-Cue oder einen Video-Soundtrack zu erstellen.

Mehrsprachige Gesangspassagen

Sowohl die spanische als auch die japanische Version wurden als verständlich und nah am vorgegebenen Liedtext beschrieben. Die nach bestem Wissen und Gewissen erstellten Transkriptionen lassen vermuten, dass bei jeder Darbietung die letzte Phrase des Refrains zu einem zusätzlichen musikalischen Ohrwurm umgewandelt wurde. Das ist zwar eine kleine kreative Freiheit, stellt aber dennoch eine Änderung des Liedtextes dar.

T07B-R1 – Kandidat für den japanischen Gesangspart
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“; eine Überprüfung durch Muttersprachler wird empfohlen.

Google Cloud führt Englisch, Deutsch, Spanisch, Französisch, Hindi, Japanisch, Koreanisch und Portugiesisch als unterstützte Sprachen auf. Ein spanisches und ein japanisches Beispiel reichen nicht aus, um die gleichbleibende Qualität in allen acht Sprachen zu belegen; daher bleibt die Überprüfung durch Muttersprachler die sinnvolle Voraussetzung für die Freigabe.

Negative Einschränkungen können fehlschlagen

T08 hatte darum gebeten, auf Gesang, Sprache, Chor, Riser und filmische Effekte zu verzichten. In der Hörbewertung enthielt das Ergebnis dennoch kurze Gesangsausschnitte und einen Riser, obwohl die vorgesehene Minimal-Techno-Richtung mit 124 BPM und der klare Ausklang vorhanden waren.

T08-R1 – Beispiel für einen Fehler bei einer negativen Nebenbedingung
Repräsentative Beispiele aus dem Bereich „Broly Anywhere Tasks“.

Auf der Modellseite von Google Cloud wird ausdrücklich darauf hingewiesen, dass negative Vorgaben nicht unterstützt werden. Sie können weiterhin positive Ausschlüsse in natürlicher Sprache formulieren, das Ergebnis sollte jedoch eher als Orientierungshilfe denn als strenger Filter betrachtet werden.

Kontaktabzug mit Wellenformen für elf repräsentative Ausgabebeispiele des Lyria 3 Pro, darunter Beispiele für starke, variable und fehlgeschlagene Befolgung der Eingabeaufforderung
Zu den repräsentativen Ergebnissen gehören erfolgreiche und widersprüchliche Durchläufe; die Wellenformen zeigen lediglich die Amplitudenhüllkurve und die relative Länge.

Lyria 3 Pro – Tipps: Die Formel, die am besten funktioniert hat

Der Leitfaden von Google empfiehlt, Genre, Stimmung, Instrumentierung, Tempo, Gesang und Text zu kombinieren. Unsere erfolgreichsten Prompts enthielten zwei weitere Aspekte: eine klare Reihenfolge der Abschnitte und ein explizites Ende.

Offizielles Google Cloud-Prompt-Framework für Lyria-3-Modelle
Die von Google empfohlene Lyria-Prompt-Formel: Genre, Stimmung, Instrumentierung, Tempo, Gesang und Text.

Eine praktische Prompt-Formel für Lyria 3 Pro lautet:

  1. Länge und Format: “Erstelle einen 90-Sekunden-Instrumental-Track.”
  2. Genre und Stimmung: Nennen Sie einen Hauptstil und eine emotionale Ausrichtung.
  3. Tempo, Tonart und Taktart: Verwenden Sie genaue Werte, wenn es darauf ankommt.
  4. Besetzung: Nenne die Klänge, die das Arrangement prägen.
  5. Gesang und Text: Geben Sie die Stimmlage, die Sprache, die Aussprache und den genauen Text an.
  6. Aufbau: Definiere Intro, Strophen, Refrains, Bridge, Solo und Outro.
  7. Schluss: Fordern Sie einen sauberen Stopp, einen aufgelösten Akkord, einen unaufgelösten Akkord oder ein Ausklingen an.

Der häufigste Fehler besteht darin, zu viele Einschränkungen zu fordern und davon auszugehen, dass diese als Garantien gelten. Die Fehler bei T04 und T08 zeigen, warum auf die Eingabeaufforderung ein Auswahlschritt folgen sollte und nicht ein blinder Veröffentlichungsschritt.

Die im Test verwendeten genauen Aufgabenstellungen

Die folgenden Befehle entsprechen genau dem Text, der für die in diesem Testbericht behandelten Durchläufe gesendet wurde.

T01 – Wiederholbarkeit von Synth-Pop mit derselben Eingabeaufforderung

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen ausgefeilten 90-Sekunden-Synth-Pop-Song auf Englisch mit 112 BPM im 4/4-Takt. Stimmung: hoffnungsvoll nach einer schwierigen Nacht. Instrumentierung: warmer analoger Synth-Bass, heller Arpeggio-Synth, knackiges elektronisches Schlagzeug, klare Akzente der E-Gitarre und ein kurzes melodisches Synth-Solo. Verwende eine natürliche weibliche Leadstimme mit klarer Aussprache. Schreibe einen eigenen Text mit einem 10-sekündigen Intro, Strophe 1, Pre-Chorus, einprägsamem Refrain, Strophe 2, wiederholtem Refrain, einem kurzen Synth-Solo und einem klaren, aufgelösten Outro. Halte den Mix luftig und radiotauglich; vermeide gesprochene Erzählungen und Publikumsgeräusche.

T02 – exakte, individuell angepasste Liedtexte

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen 100 Sekunden langen Alternative-Pop-Song mit 96 BPM, bestehend aus einem intimen Klavier, einer gedämpften E-Gitarre, einem sanften Bass, zurückhaltendem Schlagzeug und einer ausdrucksstarken männlichen Leadstimme. Singe den folgenden Originaltext wortgetreu und behalte dabei die Abschnittsbezeichnungen als Struktur bei, ohne diese jedoch auszusprechen. Füge keine Textzeilen hinzu, lass keine weg, ändere nicht die Reihenfolge und wiederhole keine Textzeilen über den geschriebenen, wiederholten Refrain hinaus.

[Strophe 1]
Die Uhr im Flur ging fünf Minuten nach
Ein blauer Morgen wartete unter der Tür
Ich packte die Karte ein, die wir nie benutzt hatten
Und ließ im zweiten Stock ein Licht an

[Refrain]
Wenn die Straße heute Nacht unsere Namen vergisst
Folge dem Fluss, folge dem Licht
Ich werde dort warten, wo sich die Brücken biegen
Und die Note festhalten, die wir nicht beenden konnten

[Strophe 2]
Ein Papiermond huschte über die Windschutzscheibe
Die Stadt löste sich in silbernem Regen auf
Ich hörte deine Stimme im Rauschen des Radios
Dann stellte ich wieder auf die Stille ein

[Refrain]
Wenn die Straße heute Nacht unsere Namen vergisst,
folge dem Fluss, folge dem Licht.
Ich werde dort warten, wo sich die Brücken biegen,
mit der Notiz in der Hand, die wir nicht beenden konnten.

[Bridge]
Kein letztes Wort, kein abschließendes Zeichen,
nur dein kleiner Kompass neben meinem.

Ende mit einer kurzen instrumentalen Auflösung nach der Bridge.

T03 – zeitgesteuerte Strukturkontrolle

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen 120 Sekunden langen, cineastischen Elektronik-Song in e-Moll mit 100 BPM und halte dich dabei so genau wie möglich an folgende Zeitleiste: 0:00–0:10 Intro mit gefiltertem Synthesizer und entferntem Puls; 0:10–0:35: Strophe mit tiefem weiblichen Gesang und spärlicher Kick-Drum; 0:35–0:55: weitläufiger Refrain mit vollem Schlagzeug und mehrstimmigen Harmonien; 0:55–1:15: Instrumental-Break, angeführt von Cello und granularem Synthesizer; 1:15–1:38: zweite Strophe mit stärkerem Bass; 1:38–1:55: abschließender Refrain; 1:55–2:00: entschlossenes Zwei-Akkord-Ende ohne Ausblenden. Der englische Originaltext sollte das Durchqueren einer Stadt vor Sonnenaufgang beschreiben. Füge keine gesprochenen Worte oder Geräusche außerhalb der Musik ein.

T04 – instrumentale Wiedergabetreue

Verwendete Eingabeaufforderung

PROMPT

Erstelle einen 90-sekündigen instrumentalen Film-Soundtrack ohne jeglichen Gesang, Flüstern, Sprechgesang, Sprache oder Chor. Stil: zurückhaltende Science-Fiction-Spannung bei 72 BPM. Instrumentierung: tiefes Cello-Ostinato, gedämpfte Klavierimpulse, sanfter analoger Drone, mit Besen gespielte Rahmentrommel und gelegentliche Glasharmonien. Bauen Sie den Track von einem spärlichen Anfang auf einen kontrollierten Höhepunkt bei 1:05 auf und lassen Sie ihn dann auf einem klaren, unaufgelösten Akkord enden, ohne auszufaden. Achten Sie auf eine kohärente akustische Tiefe und einen sauberen Bassbereich.

T05 – Kohärenz bei Langformtexten

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen 180 Sekunden langen Instrumental-Post-Rock-Track in d-Moll, im 6/8-Takt und mit etwa 84 BPM. Beginnen Sie mit einer fingergepickten E-Gitarre und Raumklang, führen Sie nach 30 Sekunden Bass und Toms ein, fügen Sie nach 70 Sekunden ein zurückhaltendes Streichquartett hinzu, erreichen Sie das Haupt-Crescendo zwischen 2:05 und 2:35, kehren Sie dann zum Gitarrenmotiv des Anfangs zurück und beenden Sie den Titel sauber bis 3:00. Kein Gesang, Chor, Sprechstimme oder Soundeffekte. Behalte ein wiedererkennbares Vier-Noten-Motiv über das gesamte Stück hinweg bei und vermeide abrupte Genrewechsel, Loop-Artefakte oder ein abgeschnittenes Ende.

T06 – BPM, Tonart, Taktart und Solo-Timing

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen 100 Sekunden langen instrumentalen Neo-Soul-Groove in Fis-Moll mit genau 92 BPM im 4/4-Takt. Verwende ein Rhodes-E-Piano, einen E-Bass im Fingerstyle, trockene Rim-Click-Drums, eine gedämpfte Rhythmusgitarre und ein Tenorsaxophon-Solo von etwa 0:55 bis 1:15. Halte die Harmonie im Fis-Moll-Tonartzentrum, setze geschmackvolle Synkopen ein, verzichte auf Gesang und Chor und beende den Titel mit einem bewussten Band-Stopp statt eines Fades.

T07A – Spanischer Gesang

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen 90 Sekunden langen spanischsprachigen Akustik-Popsong mit 104 BPM, bestehend aus einer Nylonsaitengitarre, einem Kontrabass, Handpercussion, sanftem Klavier und einer natürlichen weiblichen Leadstimme. Singe diese Originalzeilen deutlich und übersetze sie nicht: [Strophe] Entre luces de la ciudad, guardo un mapa de papel. Jede Straße spricht wieder, jeder Schatten weiß, wer. [Refrain] Folge dem Fluss bis zum Meer, lass die Angst am Bahnhof zurück. Wenn die Nacht wieder hereinbricht, werde ich ein neues Lied anzünden. Wiederhole den Refrain einmal, füge ein kurzes Gitarrenzwischenspiel hinzu und beende das Stück sauber ohne gesprochene Erzählung.

T07B – Japanische Gesangsstimmen

Verwendete Eingabeaufforderung

PROMPT

Komponiere einen 90 Sekunden langen Dream-Pop-Song in japanischer Sprache mit 108 BPM, bestehend aus einer klaren E-Gitarre, warmen Synth-Pads, einem melodischen Bass, leichten elektronischen Drums und einer natürlichen weiblichen Leadstimme. Singe diese Originalzeilen deutlich und übersetze sie nicht: [Strophe] 夜明け前の駅で、静かな風を待つ。忘れた地図の上、青い光が揺れる。 [Refrain] Lass uns den Fluss überqueren, hin zu einem namenlosen Morgen. Mit einem kleinen Lied im Herzen machen wir uns erneut auf den Weg. Wiederhole den Refrain einmal, füge eine kurze instrumentale Überleitung ein und beende den Song sauber, ohne gesprochene Erzählung.

T08 – API-Artefakt und Test mit negativen Einschränkungen

Verwendete Eingabeaufforderung

PROMPT

Erstelle einen 60-sekündigen instrumentalen Minimal-Techno-Track mit 124 BPM in A-Moll, mit einem trockenen Kick, einer knackigen geschlossenen Hi-Hat, einem abgerundeten Mono-Bass, einem metallischen Percussion-Motiv und einem sich langsam öffnenden, gefilterten Synthesizer. Keine Gesangspassagen, keine Sprache, kein Chor, keine Riser und keine filmischen Soundeffekte. Halte das Arrangement bewusst einfach und beende den Track mit einem sauberen One-Beat-Stopp, damit die zurückgegebenen Werte für Dauer, Format, Samplerate, Bitrate, Kanalanzahl, Metadatenblöcke und das Endverhalten überprüft werden können.

Preise für das Lyria 3 Pro

Google's Preisseite für die Gemini-Entwickler-API führt „Lyria 3 Pro Preview“ unter folgendem Link auf: $0,08 pro Anfrage für einen kompletten Song und eine Vorschau auf den „Lyria 3“-Clip unter $0,04 pro 30-Sekunden-Song. Keines der beiden Lyria-Modelle verfügt über eine kostenlose Gemini-API-Stufe. Die Abrechnung erfolgt pro Anfrage und nicht pro Token.

Gemini API-Preise für Lyria 3 Clip und Lyria 3 Pro – Vorschau
Offizielle Gemini-API-Preise, überprüft am 10. August 2026.

ROUTE

Gemini-Entwickler-API

MODELL / PRODUKT

lyria-3-pro-Vorschau

GETESTETES MODELL

OFFIZIELLER PREIS

$0,08 pro vollständigem Song

WICHTIGE EINSCHRÄNKUNG

Keine kostenlose Nutzungsstufe; Preview-Modell

ROUTE

Gemini-Entwickler-API

MODELL / PRODUKT

lyria-3-clip-vorschau

OFFIZIELLER PREIS

$0,04 pro 30-Sekunden-Song

WICHTIGE EINSCHRÄNKUNG

Feste Kurzform der Rolle

ROUTE

Google Wolke

MODELL / PRODUKT

Vorschau auf Lyria 3 Pro

OFFIZIELLER PREIS

Aktuelle Preise von Lyria anzeigen

WICHTIGE EINSCHRÄNKUNG

Es gelten die Bedingungen und Kontingente für die Vorschau

ROUTE

Gemini-Konsumprodukt

MODELL / PRODUKT

Lyria Music Generation

OFFIZIELLER PREIS

Der Zugang im Rahmen eines Abonnements variiert je nach Tarif und Region

WICHTIGE EINSCHRÄNKUNG

Nicht dieselbe Abrechnungsroute wie bei der API

ROUTE

Die „Broly Anywhere“-Route getestet

MODELL / PRODUKT

lyria-3-pro

OFFIZIELLER PREIS

Die API-Antwort gab die Upstream-Kosten mit $0,08 an.

WICHTIGE EINSCHRÄNKUNG

Standortspezifisches Angebot, kein Verkaufsversprechen

Im Zusammenhang mit dem Abonnement beginnen Sie mit dem aktuellen Google AI Plus im Test: Bewertung und verborgene Einschränkungen.

Die Vergleich zwischen den Tarifen „Google AI Plus“ und „Pro“ grenzt die Tarifgrenzen ab, die leicht mit dem API-Zugriff verwechselt werden können.

Informationen zur reinen Preisabfrage finden Sie in der aktuellen Preise für das Google AI Plus-Abonnement.

Der regionale Zugang kann sich ändern; die Google AI Plus: Verfügbarkeit in den USA und Preisübersicht erläutert, warum ein Verbraucherabonnement nicht als uneingeschränkter API-Zugang betrachtet werden sollte.

Wenn der Preis der entscheidende Faktor ist, spricht die einfache Rechnung dafür: 10 Pro-Generationen kosten $0,80 vor Steuern und Plattformanpassungen. Die versteckten Kosten entstehen durch den Zeitaufwand für die Überarbeitung. Für exakte Liedtexte oder Instrumentierungen sind möglicherweise mehrere Ausgabevorgänge erforderlich, selbst wenn die API selbst kostengünstig ist.

Lyria 3 Pro API: Modell-ID, Anfrage und Ausgabe

Für die offizielle Gemini-Route verwenden Sie die Gemini Interactions API – Musik-Workflow mit Modell-ID lyria-3-pro-Vorschau. Die Antwort enthält praktische Eigenschaften für generierte Audiodaten und generierten Text. Die Audiodaten sind Base64-kodiert; der Text kann Liedtexte oder Strukturinformationen enthalten.

Technische Daten und Sprachunterstützung des Vertex AI Lyria 3 Pro
Technische Daten zur Vorschau auf den „Lyria 3 Pro“ von Vertex AI, einschließlich einer MP3-Ausgabe von 184 Sekunden bei 44,1 kHz.

Python-Beispiel auf der Grundlage der aktuellen Dokumentation von Google

PYTHON

import base64
from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="lyria-3-pro-preview",
    input=(
 "Ein 90 Sekunden langer, cineastischer Elektronik-Song in e-Moll. "
 "Beginne mit einem gefilterten Puls, baue ihn zu einem breiten Chorus auf, "
 "füge einen von einem Cello angeführten Instrumental-Break hinzu und beende den Song ohne Ausblenden."
    ),
)

generated_audio = interaction.output_audio
if generated_audio:
    with open("lyria-song.mp3", "wb") as file:
    file.write(base64.b64decode(generated_audio.data))

lyrics_or_structure = interaction.output_text
if lyrics_or_structure:
    print(lyrics_or_structure)

Laut dem Leitfaden von Google ist MP3 das Standardformat. Dort wird außerdem Folgendes beschrieben: response_format={"type": "audio"} für die Anforderung einer Pro-Audio-Ausgabe in dem von diesem Interactions-API-Ablauf unterstützten Format, einschließlich der dokumentierten WAV-Option. Die aktuelle Modellseite von Google Cloud ist enger gefasst: Dort werden MP3, 44,1 kHz und 192 kbps aufgeführt. Nennen Sie bei der Beschreibung der Formate die jeweilige Oberfläche, anstatt eine universelle Spezifikation anzugeben.

Die getestete „Anywhere“-Route war ebenfalls asynchron, ihr Aufgabenschema ist jedoch ortsspezifisch. Sie gab die Felder „Aufgaben-ID“, „Status“, „Fortschritt“, „Audio-URL“, „Zeitstempel“, „Anbieter“ und „Kosten“ zurück. Fügen Sie dieses Antwortschema nicht in den Gemini-Code ein und gehen Sie nicht davon aus, dass es sich um das offizielle Schema von Google handelt.

Lyria 3 Pro vs. Lyria 3 Clip vs. Lyria 3.5

ModellOptimale VerwendungLängeStelle ab August 2026
Vorschau auf den „Lyria 3“-ClipLoops, Vorschauen, kurze Videomusik30 SekundenGemini API-Vorschau; $ 0,04 pro Anfrage
Vorschau auf Lyria 3 ProGanze Lieder, Strophen, Refrains, BrückenBis zu 184 Sekunden auf Google CloudGemini/Google Cloud-Vorschau; $0,08/Anfrage
Lyria 3.5Musikqualität der neuesten Generation und „Flow Music“-KompositionBis zu drei Minuten bei der aktuellen DeepMind-PositionsbestimmungVeröffentlicht über Flow Music; es handelt sich nicht um die in diesem API-Test verwendete Modell-ID

Entscheiden Sie sich für „Clip“, wenn es auf Geschwindigkeit und kurze Ausgabeform ankommt. Wählen Sie „Pro“, wenn Sie einen kompletten Song über die dokumentierte API benötigen. Entscheiden Sie sich für „Lyria 3.5“, wenn Ihnen das neueste Flow-Music-Erlebnis wichtiger ist als die Verwendung der Pro-API-Modell-ID.

Lyria ist zudem enger gefasst als ein universelles Audiomodell. Wenn in einem Auftrag Dialoge, Geräusche, Umgebungsgeräusche und Musik in einer generierten Szene miteinander kombiniert werden, dann ist das Seed Audio 1.0 – Testbericht zu Sprachaufnahmen, Soundeffekten und Musik deckt diesen anderen Arbeitsablauf ab.

Erfahren Sie hier, wie es bei der Videoproduktion funktioniert Veo 3.1 verarbeitet Ton und Hintergrundaudio.

Wenn die Sprachwiedergabe und die Synchronisation das größere Problem darstellen, nutzen Sie die praktische Veo 3.1 Arbeitsablauf für Dialoge, Audio und Lippensynchronisation.

Sicherheit, SynthID, kommerzielle Nutzung und Einschränkungen

Laut Google enthalten die Ausgabedaten von Lyria 3 ein SynthID-Wasserzeichen. Die Aktuelle Spezifikationen von Google Cloud Außerdem sind Content Credentials (C2PA), Eingabefilterung, Filterung der Ausgabewiedergabe sowie Filterung der Stimmähnlichkeit aufgeführt. Diese Kontrollmechanismen dienen der Rückverfolgbarkeit und Sicherheit; sie entbinden Sie jedoch nicht von der Pflicht, für Ihr eigenes Projekt die Rechte an Liedtexten, Referenzbildern, Samples, Abbildungen und die Vertriebsrechte zu klären.

Offizielle Einschränkungen der Gemini-API für die Musikgenerierung mit Lyria 3
Google dokumentiert Sicherheitsfilter, SynthID, die Erzeugung einzelner Umdrehungen, Schwankungen in der Dauer und Nichtdeterminismus.

Google Cloud bezeichnet Lyria 3 Pro als „Generative AI Preview“-Angebot. Auf der entsprechenden Seite heißt es, dass Kunden die Preview-Version für Produktions- oder kommerzielle Zwecke nutzen und die generierten Ergebnisse an Dritte weitergeben dürfen, vorbehaltlich der Bedingungen für die Pre-GA-Phase und der Vereinbarung über den Zugriff. Dies ist jedoch nicht gleichbedeutend mit einer bedingungslosen Zusicherung, dass jeder generierte Titel risikofrei oder exklusiv ist.

Die praktischen Grenzen sind klar:

  • Die Modelle in der Vorschau können sich vor der Veröffentlichung der stabilen Version noch ändern.
  • Bei der Preisgestaltung für die Gemini-API gibt es für Lyria 3 keine kostenlose Nutzungsstufe.
  • Eine Eingabeaufforderung liefert einen Audioclip auf der aktuellen Google Cloud-Modellseite.
  • Negative Eingabeaufforderungen werden als offizielle Funktion nicht unterstützt.
  • Die aktuelle Musikgenerierung mit Gemini erfolgt in einem einzigen Durchgang und nicht über einen In-Place-Multi-Turn-Editor.
  • Die Dauer und die konsequente Einhaltung sind unterschiedlich.
  • Die genauen Liedtexte, die BPM, die Tonart und die Zeitstempel müssen noch einer Qualitätssicherung auf Ausgabebene unterzogen werden.

Für wen ist Lyria 3 Pro geeignet?

Nutzen Sie Lyria 3 Pro, wenn Sie als Entwickler, Filmemacher, Spieleentwickler, Songwriter oder Content-Team über eine API komplette musikalische Ideen erhalten und mehrere Vorschläge prüfen möchten. Das Tool überzeugt insbesondere bei cineastischen Kompositionen, Pop-Strukturen, langen Instrumentalpassagen und mehrsprachigen Gesangsdemos.

Lassen Sie es lieber sein – oder halten Sie ein zweites Tool griffbereit –, wenn Sie deterministische Stems, exakte Bearbeitung nach der Generierung, garantierte negative Einschränkungen oder eine endgültige, gemasterte Veröffentlichung auf Basis einer einzigen Anfrage benötigen. Lyria 3 Pro ist besser darin, einen überzeugenden Take zu generieren, als jede Anweisung so zu befolgen, als wäre es eine DAW-Automationsspur.

GlobalGPT's browserbasierte Audio-Tools kann die damit verbundene Sprach- und Transkriptionsarbeit an einem Ort unterstützen, doch diese öffentliche Seite ist eine von der hier getesteten Lyria-API getrennte Produktoberfläche. In der Rezension wird nicht behauptet, dass es sich bei der Seite um einen verifizierten Lyria 3 Pro-Zugang handelt.

Google Lyria 3 Pro – Häufig gestellte Fragen

Ist Lyria 3 Pro das neueste Musikmodell von Google?

Nein. Seit dem 10. August 2026 bezeichnet Google DeepMind „Lyria 3.5“ als sein neuestes Modell zur Musikgenerierung und bewirbt es über Flow Music. „Lyria 3 Pro“ bleibt weiterhin das dokumentierte Modell zur Vorschau ganzer Songs für die Entwicklerkanäle „Gemini“ und „Google Cloud“ unter lyria-3-pro-Vorschau.

Wie viel kostet das Lyria 3 Pro?

In der Gemini-Entwickler-API wird die „Lyria 3 Pro Preview“ mit $0,08 pro Anfrage für einen kompletten Song angegeben. Die „Lyria 3 Clip Preview“ kostet $0,04 pro 30-Sekunden-Song. Keines der beiden Modelle verfügt über eine kostenlose Gemini-API-Stufe, und für Verbraucherabonnements gelten andere Tarif- und regionale Bestimmungen.

Wie lang darf ein Song auf dem Lyria 3 Pro sein?

Laut offiziellen Angaben von Google sind bis zu drei Minuten möglich. Auf der aktuellen technischen Seite von Google Cloud wird eine maximale Länge von 184 Sekunden für Audioclips angegeben. Bei unseren beiden Tests mit einer Dauer von jeweils 180 Sekunden betrug die Länge der zurückgegebenen MP3-Dateien 176,170 bzw. 177,006 Sekunden.

Kann Lyria 3 Pro genau die von mir gewünschten Texte singen?

Ja, aber nicht deterministisch. Eine von drei wiederholten benutzerdefinierten Textvarianten stimmte in der Hörtranskription exakt mit dem bereitgestellten Text überein. Bei einer anderen fehlte der größte Teil der letzten Zeile der Bridge, und bei der dritten wurden Echo-Wiederholungen hinzugefügt. Vergleichen Sie stets den vollständigen Gesangstext mit dem Originaltext.

Kann Lyria 3 Pro Instrumentalmusik ohne Gesang erzeugen?

Ja, aber ein schriftlicher Ausschluss ist keine feste Garantie. Bei einem Instrumental-Test blieb die Stimme aus, während der Test mit Minimal-Techno-Einschränkung trotz der Vorgabe “keine Gesangspassagen” Gesangspassagen hinzufügte. Google Cloud kennzeichnet negative Eingabeaufforderungen auf der aktuellen Modellseite zudem als nicht unterstützt.

Wie lautet die Modell-ID der Lyria 3 Pro API?

Die offizielle Gemini- und Google Cloud-Modell-ID lautet lyria-3-pro-Vorschau. Bei der praktischen Demonstration in diesem Testbericht wurde die Routen-ID eines Drittanbieters verwendet lyria-3-pro; das zugehörige Aufgabenschema und die Namenskonventionen sollten nicht als Ersatz für die offizielle Interactions-API von Google dienen.

In welchem Dateiformat gibt Lyria 3 Pro die Ergebnisse aus?

Im Gemini-Leitfaden von Google wird MP3 als Standardformat angegeben, und in der Interactions-API wird eine Option für das Ausgabeformat „Pro“ dokumentiert. Google Cloud gibt 44,1 kHz und 192 kbit/s für MP3 an. Alle 18 Dateien aus unserem Test entsprachen dieser Spezifikation für Stereo-MP3 mit 44,1 kHz und 192 kbit/s.

Kann Lyria 3 Pro kommerziell genutzt werden?

Laut Google Cloud können Kunden dieses Preview-Angebot für Produktions- oder kommerzielle Zwecke nutzen und die generierten Ergebnisse veröffentlichen, vorbehaltlich der Bedingungen vor der allgemeinen Verfügbarkeit (Pre-GA) und der Zugangsvereinbarung. Bitte lesen Sie diese Bedingungen sorgfältig durch und stellen Sie sicher, dass keine Liedtexte, Abbildungen, Samples oder Referenzmedien enthalten sind, bevor Sie die Ergebnisse verbreiten.

Kann ich Lyria 3 Pro auf einem GlobalGPT verwenden?

Dieser Bericht erhebt keinen Anspruch auf eine verifizierte öffentliche GlobalGPT-Lyria-Route. Die 18 praktischen Generationen wurden über die Broly Anywhere Tasks-API ausgeführt, während die öffentliche Audio-Seite von GlobalGPT derzeit einen separaten Arbeitsbereich für Sprache und Transkription bereitstellt. Verwenden Sie Gemini oder Google Cloud für den dokumentierten offiziellen API-Weg.

Endgültiges Urteil

Google Lyria 3 Pro ist ein zuverlässiges API-Modell für ganze Songs, das sich durch niedrige Kosten pro Anfrage, kohärente Langform-Ausgaben und ungewöhnlich detaillierte Steuerungsmöglichkeiten für die Eingabeaufforderung auszeichnet. Der Test mit 18 Durchläufen deckte zudem einen Aspekt auf, der in den Einführungsdemos verborgen bleibt: Strukturelle Details, der genaue Liedtext, die namentlich genannten Instrumente und negative Einschränkungen können sich bei identischen Anfragen ändern.

Dieser Kompromiss ist akzeptabel, wenn man zwei oder drei Varianten generieren, den gesamten Song vergleichen und die beste Aufnahme behalten kann. Für diesen Arbeitsablauf lässt sich Lyria 3 Pro ohne Weiteres empfehlen. Für eine deterministische Textwiedergabe oder bearbeitungsfertige Präzision auf Basis einer einzigen Anfrage sind jedoch weiterhin eine Überprüfung durch einen Menschen und eine DAW erforderlich.

Teilen Sie den Beitrag:

Verwandte Beiträge