Gemini Omni Flash API – Leitfaden zu Preisen, Limits und Zugriff

gemini-omni-flash-api-preise-limits

Gemini Omni Flash ist Googles neues Vorschau-Modell für die multimodale Videogenerierung und die dialogbasierte Videobearbeitung. Für API-Nutzer lautet die zu beachtende Modell-ID gemini-omni-flash-Vorschau. Die Preisgestaltung lässt sich ganz einfach wie folgt zusammenfassen: Preise für die Gemini-API listet die Videoausgänge unter $17,50 pro 1 Million Video-Output-Token, das Google wie folgt beschreibt: $0,10 pro Sekunde bei 720p-Videos.

Verwirrend ist, dass der Begriff “Gemini Omni Flash-Preise” drei verschiedene Bedeutungen haben kann. Entwickler interessieren sich möglicherweise für die Preise der Gemini-API-Token. Kreative interessieren sich möglicherweise für Google-KI-Abonnements und Flow-Guthaben. Normale Nutzer interessieren sich vielleicht weniger für SDKs und mehr dafür, ob sie einen Arbeitsbereich öffnen und sofort mit dem Modell Inhalte erstellen können.

Das ist der Punkt, an dem GlobalGPT passt nahtlos dazu. GlobalGPT Pro umfasst nun den Zugriff auf Gemini Omni Flash sowie die breitere Modellpalette auf der Plattform – mit Ausnahme von Google Veo 3.1. Die aktuelle Preis für GlobalGPT Pro ist $10,8 pro Monat bei jährlicher Abrechnung, oder $15 pro Monat im Rahmen der aktuellen Monatsaktion. Für Nutzer, die Omni ausprobieren möchten, ohne API-Schlüssel, Abrechnungsprojekte oder SDK-Aufrufe einrichten zu müssen, kann dies der einfachere Weg sein.

Im Folgenden finden Sie eine praktische Übersicht: Was Omni über die API kostet, was die Google-AI-Tarife beinhalten, welche Beschränkungen in der Preview-Version gelten und wie Sie sich zwischen API-Zugriff, Google Flow und GlobalGPT Pro entscheiden können.

Preise für Gemini Omni Flash: Die Kurzfassung

Wenn Sie nur die Zahlen benötigen, ist „Gemini Omni Flash“ ein kostenpflichtiges Modell in der Gemini-API. Für Omni Flash gibt es keine kostenlose API-Stufe. Die kostenpflichtigen Google-AI-Abonnements beinhalten ebenfalls den Zugriff auf Omni über Flow-Credits, während GlobalGPT Pro Nutzern einen einfacheren Weg für die Nutzung mehrerer Modelle bietet, wenn sie sich nicht um die Einrichtung der API kümmern möchten.

AnfahrtswegBestätigter PreisBeste PassformWichtigster Hinweis
Zwillings-API$1,50 / 1 Mio. Eingabe-Token; $9 / 1 Mio. Text-Ausgabe-Token; $17,50 / 1 Mio. Video-Ausgabe-Token; ca. $0,10 pro Sekunde bei 720p-VideoEntwickler, Produktteams, Automatisierung, Batch-TestsKeine kostenlose API-Stufe; erfordert die Einrichtung der API und die Überwachung der Nutzung
Google AI Plus$4,99 pro Monat, 200 Flow-CreditsEinfache Tests mit den Kreativ-Tools von Google für EndverbraucherDie genauen Omni-Kreditkosten pro Generation müssen vor der Veröffentlichung einer Kredit-Tabelle pro Video noch anhand der Live-Flow-Daten überprüft werden.
Google KI Pro$19,99 pro Monat, 1.000 Flow-CreditsKreative, die bereits mit Google Flow arbeitenGuthaben sind nützlich, aber sie sind nicht dasselbe wie die API-Abrechnung
Google KI Ultra$99,99 pro Monat mit 10.000 Flow-Credits oder $199,99 pro Monat mit 25.000 Flow-CreditsIntensive Nutzer von Google Flow und kreative Arbeitsabläufe mit hohem ArbeitsaufkommenHöhere monatliche Ausgaben sind nur dann sinnvoll, wenn Flow bereits eine zentrale Rolle im Arbeitsablauf spielt
GlobalGPT Pro$10.8 pro Monat bei jährlicher Abrechnung; $15 pro Monat im Rahmen der aktuellen monatlichen SonderaktionNutzer, die Omni sowie mehrere KI-Modelle in einem Abonnement nutzen möchtenKein Ersatz für eine Entwickler-API-Konsole oder alle offiziellen Funktionen der Google-Apps
In der Preisliste für Googles APIs wird „Gemini Omni Flash“ als kostenpflichtiges Modell aufgeführt, wobei die Kosten für die Videoausgabe bei etwa $0,10 pro Sekunde für 720p-Videos liegen.

Was ist Gemini Omni Flash?

Gemini Omni Flash ist ein Vorschau-Videomodell in der Gemini-API. Googles Omni-API-Dokumentation Der Schwerpunkt liegt auf nativer Multimodalität, dialogorientierter Bearbeitung und Weltwissen. In der Praxis ist das System darauf ausgelegt, kurze Videos aus Text zu generieren, Referenzbilder zu verwenden und genügend Kontext für nachfolgende Bearbeitungen zu bewahren, sofern der Arbeitsablauf dies zulässt.

Die API-Modell-ID lautet gemini-omni-flash-Vorschau. Das Wort “Vorschau” ist entscheidend. Es bedeutet, dass das Modell für Tests und erste Produktionsversuche zur Verfügung steht, sich jedoch Preise, Einschränkungen, Funktionsumfang und Verhalten noch schneller ändern können als bei einer stabilen Modellreihe.

Google listet Gemini Omni Flash unter der Modell-ID „gemini-omni-flash-preview“ auf.

Die besten Anwendungsfälle sind kurze Produktaufnahmen, Social-Video-Konzepte, Tests animierter Werbemittel und Videobearbeitungen, bei denen die gewünschte Änderung konkret ist. Es handelt sich nicht um einen vollwertigen Editor für Langform-Videos. Die derzeitigen Einschränkungen bei der Vorschau lassen sich besser als schnelle Erstellungsfunktion für kurze Clips verstehen und nicht als vollständige Postproduktions-Suite.

So greifen Sie auf Gemini Omni Flash zu

Es gibt drei praktische Zugangswege: die Gemini-API, Google-AI-Tarife mit Flow-Guthaben und GlobalGPT Pro. Diese überschneiden sich zwar, lösen jedoch unterschiedliche Probleme.

Option 1: Gemini-API

Die Gemini-API-Route richtet sich an Entwickler und technische Teams. Sie ist besonders sinnvoll, wenn Sie Omni in ein Produkt integrieren, wiederholbare Tests durchführen, Clips aus strukturierten Eingabeaufforderungen generieren oder Kosten auf Anfragsebene nachverfolgen möchten. Der Nachteil liegt in der Einrichtung: Sie benötigen eine Abrechnungslösung, API-Zugriff, eine Anforderungsverarbeitung, Speicherplatz sowie einen eigenen Workflow für Wiederholungsversuche und Mediendateien.

Für Teams, die bereits die Kosten für die Videoerstellung vergleichen, ist der API-Weg der einfachste Weg, die Kosten pro Clip zu berechnen. Ein 10-Sekunden-Clip in 720p verursacht Videoproduktionskosten von etwa $1,00, wobei die Kosten für Eingabetoken und die zugehörige Infrastruktur noch nicht berücksichtigt sind. Kürzere Clips mit einer Länge von 3 bzw. 8 Sekunden sind proportional günstiger.

Option 2: Google-KI-Pläne und Flow-Guthaben

Google-KI-Abonnements sind für Creator, die Omni über die Creative-Interfaces von Google nutzen möchten, einfacher. In den Vereinigten Staaten ist das kostenpflichtige Google-KI-Pläne Omni-Zugang und monatliche Flow-Guthaben anzeigen: „Plus“ für $4,99 mit 200 Guthabenpunkten, Pro für $19,99 mit 1.000 Credits und Ultra für $99,99 mit 10.000 Credits oder $199,99 mit 25.000 Credits.

Die Tarife „Google AI Plus“, „Pro“ und „Ultra“ beinhalten ausdrücklich Flow-Guthaben mit Gemini Omni Flash-Zugriff.

Flow-Credits sollten nicht mit der Abrechnung von Gemini-API-Token verwechselt werden. Guthaben sind ein Kontingent für Endverbraucherprodukte. API-Token sind eine Abrechnungseinheit für Entwickler. Wenn Ihre Hauptfrage lautet: “Wie viel kostet meine App pro generierter Sekunde?”, verwenden Sie den API-Preis. Wenn Ihre Hauptfrage lautet: “Wie viele Kreativversuche stehen mir in Flow zur Verfügung?”, nutzen Sie den Google-KI-Tarif und das Guthabenkontingent.

Option 3: GlobalGPT Pro

GlobalGPT Pro ist die praktischste Lösung für Nutzer, die Gemini Omni Flash ausprobieren möchten, ohne dass sich daraus ein API-Einrichtungsprojekt entwickelt. Der aktuelle Jahrespreis beträgt $10,8 pro Monat bei jährlicher Abrechnung, während die aktuelle monatliche Sonderaktion den Preis für Pro auf $15 pro Monat festlegt. GlobalGPT Pro bietet zudem Zugriff auf die umfassendere Modellpalette der Plattform, mit Ausnahme von Google Veo 3.1.

Wo der GlobalGPT Pro zum Einsatz kommt

Der Vorteil besteht nicht darin, dass GlobalGPT die Gemini-API ersetzt. Das tut es nämlich nicht. Der Vorteil liegt vielmehr darin, dass viele Nutzer für ihre alltäglichen Tests keine API-Konsole benötigen. Sie brauchen eine Plattform, auf der sie zwischen verschiedenen Modellen wechseln, Ergebnisse vergleichen und Inhalte erstellen können, ohne für jeden Anbieter ein separates kostenpflichtiges Abonnement abschließen zu müssen.

Erläuterung der Preisgestaltung für die Gemini Omni Flash API

Die Preisliste von Google ist übersichtlich, doch der Listenpreis allein sagt noch nichts darüber aus, ob Omni Flash ein gutes Preis-Leistungs-Verhältnis bietet. Ein aussagekräftiger Vergleichsmaßstab sind die Kosten pro erfolgreichem Clip: Dabei wird berücksichtigt, was das Modell im Hinblick auf die Videoausgabe-Gebühr liefert, nachdem die Einhaltung der Anweisungen, Wiederholungsversuche, die Fehlerbehebung und die Zuverlässigkeit des Workflows berücksichtigt wurden.

  • Eingabe: $1,50 pro 1 Million Token.
  • Textausgabe: $9,00 pro 1 Million Token.
  • Videoausgang: $17,50 pro 1 Million Token, was laut Google etwa $0,10 pro Sekunde für 720p-Videos entspricht.
  • Kostenlose API-Stufe: Nicht verfügbar für Gemini Omni Flash.

Geschätzte Kosten für die Videoausgabe nach Dauer

Gewünschte DauerGeschätzte Kosten für den API-VideoausgangAnmerkungen
3 SekundenÜber $0.30Nützlich für schnelle Bewegungstests und Übergänge
8 SekundenÜber $0.80Eine praktische Länge für Produktvorführungen und Social-Media-Clips
10 SekundenÜber $1.00Die Obergrenze des aktuellen API-Dauerbereichs

Diese Schätzungen basieren auf den Richtwerten von Google für die 720p-Videoausgabe. Eingabetoken, Speicherplatz, Wiederholungsversuche und etwaige weitere App-Kosten werden separat berechnet.

Rechtfertigt die Leistung von Omni Flash den Preis der API?

Es gibt keinen einheitlichen öffentlichen Benchmark-Wert, der die Videoqualität in einen eindeutigen Preis-Leistungs-Wert umwandelt, daher haben wir Praxistest-Set ist hier aussagekräftiger als eine synthetische Bewertung. Es wird gemessen, ob das Modell das gewünschte Format zurückgegeben, wichtige visuelle Details beibehalten, zeitgesteuerte Aktionen befolgt und den Arbeitsablauf zuverlässig abgeschlossen hat.

Praktischer Preis-Leistungs-Vergleich

MessgrößeBeobachtetes ErgebnisWas das für den Wert bedeutet
Abgeschlossene Basis- oder Generierungsanfragen5 von 5„Text-zu-Video“, die Ausgabe im Hochformat, „Bild-zu-Video“, ein Basisclip und eine zeitgesteuerte Sequenz lieferten allesamt abspielbare Videos.
Erfolgreiches Filmmaterial und geschätzte Kosten für die Videoproduktion42 Sekunden für etwa $4,27Der Listenpreis ermöglichte die Produktion mehrerer brauchbarer Kurzclips ohne großes Testbudget.
Gesteuerte Fertigstellungszeit25,7–39,2 Sekunden für abgeschlossene Aufträge mit einer Dauer von 8–10 SekundenSchnell genug für iterative Konzeptarbeit; bei diesen Zeitangaben handelt es sich nicht um Messungen der Schnittstellengeschwindigkeit von GlobalGPT.
Format und EinheitlichkeitTests im nativen 9:16-Format und mit Referenzbildern bestandenDer Preis lässt sich leichter rechtfertigen, wenn das erste Druckergebnis bereits die gewünschte Ausrichtung aufweist und das Motiv erhalten bleibt.
Zustandsbehaftete Nachbearbeitung0 von 1; HTTP 502Eine zu hohe Zuverlässigkeit bei der Bearbeitung kann die effektiven Kosten erhöhen, wenn ein Produktionsablauf von Wiederholungsversuchen abhängt.

Angesichts dieser Fakten eignet sich der API-Preis besonders gut für schnelle Ideenfindung, Produktaufnahmen, Social-Media-Konzepte und referenzbasierte Bewegungstests. Ein 8- oder 10-sekündiges 720p-Ergebnis kostet weniger als einen Dollar bzw. etwa einen Dollar an Videoausgabe, und die erfolgreichen Durchläufe sind schnell genug abgeschlossen, um eine zügige Iteration zu ermöglichen.

Bei Endprodukten oder Langform-Projekten ist die Leistung schwächer. Die Ausgabe ist auf 720p und 10 Sekunden begrenzt, die Zeitangaben waren in unserem Test nur annähernd genau, und die zustandsbehaftete Bearbeitung schlug einmal fehl. Ein Projekt, das viele Wiederholungsversuche, zusammengefügte Clips, Hochskalierung oder zuverlässige Nachbearbeitungen erfordert, kann deutlich mehr kosten, als der angegebene Preis pro Sekunde vermuten lässt.

Google-KI-Tarife vs. GlobalGPT: Welcher Preis ist sinnvoll?

Diese Optionen sollten eher anhand der Nutzung als anhand ihrer monatlichen Preise beurteilt werden. Google verkauft innerhalb seiner eigenen Kreativumgebung immer größere Speicherkapazitäten. GlobalGPT verteilt den Abonnementwert auf Omni und andere Modelle. Keiner der beiden Ansätze führt dazu, dass das zugrunde liegende Omni-Modell eine bessere Leistung erbringt, nur weil der Nutzer sich für einen teureren Tarif entscheidet.

So lesen Sie die Preisstaffel von Google

Die Tabelle ist aussagekräftiger als eine weitere Preisübersicht. Mit jedem Schritt steigt das Flow-Kontingent schneller an als die monatliche Gebühr, sodass die nominalen Kosten pro inbegriffenem Credit sinken, je höher die Nutzungsverpflichtung ist. Damit ist „Pro“ die ausgewogenere Stufe für die regelmäßige Nutzung von Flow, während „Ultra“ ein Kapazitätskauf für Nutzer ist, die tatsächlich ein viel größeres Kontingent verbrauchen können und von den anderen Premium-Funktionen von Google profitieren.

Google-KI-PlanMonatlicher Preis in den USAFlow-CreditsNennkosten pro enthaltenem CreditBeste Passform
AI Plus$4.99200Etwa 2,50 CentDer kostengünstigste offizielle Einstieg für die gelegentliche Nutzung von Flow
AI Pro$19.991,000Etwa 2,00 CentRegelmäßige Autoren, die davon ausgehen, jeden Monat in Flow neue Versionen zu erstellen
AI Ultra$99.9910,000Etwa 1,00 CentAnwendungen mit hohem Durchfluss sowie Anwender, die auch die Ultra-Funktionen schätzen
AI Ultra, Option mit höherem Limit$199.9925,000Etwa 0,80 CentSehr intensive Nutzung von Dienstwerkzeugen, bei der der höhere Zuschlag tatsächlich in Anspruch genommen wird

Vom Plus- zum Pro-Tarif verfünffacht sich das Kontingent, während sich die Gebühr etwa vervierfacht, wodurch sich die nominalen Kosten pro inbegriffenem Credit um etwa 20% verringern. Die erste Ultra-Stufe verdoppelt diese Effizienz im Vergleich zu „Pro“ noch einmal. Das sieht auf dem Papier vielversprechend aus, doch niedrigere Stückkosten sind nicht gleichbedeutend mit geringeren Gesamtkosten: Ungenutzte Kapazitäten können dazu führen, dass „Plus“ oder „Pro“ das bessere Preis-Leistungs-Verhältnis bieten, selbst wenn „Ultra“ das beste Verhältnis aufweist.

Das in der Praxis ermittelte API-Ergebnis von 42 erfolgreichen Videosekunden für etwa $4.27 ist zwar ein nützlicher Leistungsmaßstab, lässt sich jedoch nicht zur Berechnung der Anzahl der Omni-Clips heranziehen, die ein Flow-Plan erzeugen wird. Flow-Credits und API-Video-Token sind unterschiedliche Abrechnungseinheiten, und der Live-Credit-Verbrauch für jeden Omni-Vorgang muss weiterhin separat überprüft werden.

Wo der GlobalGPT Pro zum Einsatz kommt

Der Wert von GlobalGPT ist eher horizontal als volumenbasiert. Wenn Sie ausschließlich das Modell „Omni“ nutzen möchten, lassen sich die Gemini-API oder ein Google-AI-Tarif leichter bewerten, da die Abrechnungseinheit direkt den Anfragen oder der Flow-Kapazität entspricht. Wird dasselbe Abonnement auch für das Verfassen von Texten, Recherchen, Bildbearbeitung und Vergleiche zwischen mehreren Modellen genutzt, steigt sein effektiver Wert, da sich die Kosten auf mehr Workflows verteilen. Es ersetzt jedoch nach wie vor weder native Flow-Funktionen noch die API-Steuerung auf Entwicklerebene.

Welche Option ist tatsächlich kostengünstig?

Wenn Sie…Wähle…Warum
Omni in eine App integrierenZwillings-APISie benötigen eine Steuerung der Anfragen, vorhersehbare Kosten pro Sekunde und eine technische Integration.
Omni im offiziellen Google Flow mit der niedrigsten monatlichen Mindestvertragslaufzeit testenGoogle AI PlusDadurch wird der Gesamtaufwand begrenzt, während gleichzeitig genügend Kapazität zur Verfügung steht, um zu beurteilen, ob Flow zum Arbeitsablauf passt.
Jeden Monat in Flow gestalten und weiterentwickelnGoogle KI ProIm Vergleich zu „Plus“ steigt das Kontingent schneller als die Gebühr, wodurch diese Stufe die ausgewogenste für den regelmäßigen Gebrauch ist.
Ausführung von Aufträgen mit hohem Datenaufkommen in den offiziellen Kreativtools von GoogleGoogle KI UltraDie Wirtschaftlichkeit der Lösung kommt erst dann voll zur Geltung, wenn die hohe Flow-Kapazität und die zusätzlichen Google-Funktionen auch wirklich genutzt werden.
Omni wird zusammen mit mehreren KI-Modellen für die Arbeit mit Inhalten getestetGlobalGPT ProSein Wert steigt eher mit der Anzahl der verwendeten Modelle und der nicht-videobasierten Arbeitsabläufe als allein mit dem Produktionsvolumen von Omni.

Wenn Ihre Recherche zu KI-Videos über Omni hinausgeht, beginnen Sie mit dem Vergleich, der zu Ihrer nächsten Entscheidung passt. Der Sora 2 API-Preise Dieser Leitfaden ist hilfreich, wenn Sie die Entwicklerkosten vergleichen möchten, während der Sora-Videogenerierung Der Leitfaden unterstützt die Arbeitsabläufe von Entwicklern. Bei der Auswahl zwischen verschiedenen Modellen ist die Veo 3.1 gegen Sora 2 Die Aufschlüsselung ist die nächstliegende Leseart.

Gemini Omni Flash – Grenzwerte, die Sie kennen sollten

Omni Flash ist leistungsstark, aber die Vorschau hat klare Grenzen. Es ist wichtiger, diese zu verstehen, bevor man Credits ausgibt, als sich eine Modellankündigung auswendig zu lernen.

In den Versionshinweisen von Google wird angegeben, dass die Videogenerierung bei einer Auflösung von 720p über die Interactions-API 3 bis 10 Sekunden dauert.

Dauer und Auflösung

Die aktuelle API-Vorschau unterstützt Videos aus 3 bis 10 Sekunden unter 720p, wie in Googles Gemini API – Versionshinweise. Damit ist Omni Flash ein Generator für kurze Clips. Er eignet sich hervorragend für Produktmomente, Social-Media-Konzepte, Übergänge und schnelle visuelle Tests, ist jedoch nicht dafür ausgelegt, mit einer einzigen Anfrage ein vollständiges, mehrere Minuten langes Video zu erstellen.

Seitenverhältnis

Landschaft 16:9 ist die Standardeinstellung. Hochformat 9:16 kann ebenfalls angefordert werden, was für TikTok, Reels, Shorts und das Testen von „Mobile-First“-Anzeigen nützlich ist.

Bild-zu-Video

Omni unterstützt Workflows mit Referenzbildern. Das ist bei Produktaufnahmen von Bedeutung, da man so mit einem visuellen Ankerpunkt beginnen kann, anstatt das Modell zu bitten, das Objekt allein anhand des Textes zu erschaffen. Das Referenzbild benötigt dennoch eine klare Bewegungsanweisung. Eine gute Eingabeanweisung beschreibt, was sich bewegen soll, was gleich bleiben soll und wie sich die Kamera verhalten soll.

Google zeigt, wie aus einem Referenzbild und einer Bewegungsvorgabe realistisches Filmmaterial entstehen kann.

Zustandsbehaftete Videobearbeitung

Die Interactions-API kann den Videokontext für nachfolgende Bearbeitungen auf der Grundlage einer früheren Interaktion beibehalten. Für Nutzer bedeutet dies, dass sie Änderungen wie das Austauschen einer Produktfarbe oder das Anpassen eines Szenendetails anfordern können, ohne den gesamten ursprünglichen Befehl neu schreiben zu müssen. Die besten Bearbeitungen sind nach wie vor eng gefasst und konkret.

Die Interactions-API kann den Videokontext beibehalten, während nachträgliche Bearbeitungen vorgenommen werden.

Einschränkungen bei der Vorschau

Die Vorschau unterliegt zudem wichtigen technischen Einschränkungen. In der Dokumentation von Google werden Einschränkungen hinsichtlich der regionalen Verfügbarkeit, der Referenzmedien, der Sprachbearbeitung, der Interpolation, der erweiterten Parameter sowie einiger Anweisungssteuerungen aufgeführt. Die generierten Videos enthalten zudem eine SynthID, und Sicherheitsfilter können die Ergebnisse beeinflussen.

Die Vorschau-API unterliegt bestimmten Einschränkungen hinsichtlich hochgeladener Medien, Regionen, Sprachbearbeitung und erweiterter Parameter.

Es läuft ganz einfach darauf hinaus, dass Omni Flash wie ein Vorschau-Tool getestet werden sollte: Es ist robust genug, um darauf Arbeitsabläufe aufzubauen, sollte aber nicht als vollständig ausgereifte Produktionsumgebung betrachtet werden, ohne Änderungen zu überwachen.

Praxistestergebnisse zum Gemini Omni Flash

Wir haben dasselbe getestet gemini-omni-flash-Vorschau Modell, das auf GlobalGPT Pro über einen kontrollierten API-Workflow verfügbar ist.

In unseren Tests haben wir fünf praxisnahe Arbeitsabläufe untersucht: die grundlegende Umwandlung von Text in Video, die native Ausgabe im Format 9:16, die Übereinstimmung mit Referenzbildern, eine zustandsabhängige Nachbearbeitung sowie eine zeitgesteuerte 10-Sekunden-Sequenz.

So interpretieren Sie die Ergebnisse: Jedes Ausgabevideo ist mit den zugehörigen Messdaten und Überprüfungsnotizen verknüpft. Die Laufzeit entspricht der gemessenen End-to-End-Zeit im kontrollierten Workflow und nicht der Schnittstellengeschwindigkeit von GlobalGPT.

T1 · Text zu Video

Bewegungstest für Café-Latte-Art

Größtenteils bestanden
8,0 statsächliche Dauer
1280×720Entschließung
16:9tatsächliches Verhältnis
28,6 sgesteuerte Laufzeit
Ton vorhandenTitel mit 128 kbps erkannt
~$0.81geschätzte API-Kosten

Das Rosetta-Muster bleibt erkennbar, der Dampf ist weiterhin sichtbar, und die Handbewegungen sind in den aufgenommenen Bildern sauber. Die Tasse wird etwa in der Mitte leicht angehoben, anstatt sich nur an Ort und Stelle zu drehen; die Einhaltung der Anweisungen war also gut, aber nicht exakt.

Mitnehmen: Ein brauchbares Ergebnis mit hohem visuellem Realismus, doch die kleinen Details der Körperbewegungen müssen noch Bild für Bild überprüft werden.

Genaue Eingabeaufforderung anzeigen

Erstellen Sie ein 8 Sekunden langes, fotorealistisches Video im Format 16:9 in einer einzigen durchgehenden Aufnahme. Eine Keramiktasse mit Latte steht auf einem Café-Tisch aus Walnussholz neben einem sonnendurchfluteten Fenster. Die Hand eines Baristas dreht die Tasse sanft um etwa 30 Grad und enthüllt dabei ein klares Rosetta-Latte-Art-Muster. Dünner, realistischer Dampf steigt natürlich auf und kräuselt sich im Morgenlicht; die Flüssigkeitsoberfläche und die Handbewegung sollten den Gesetzen der Physik entsprechen. Verwenden Sie eine langsame, subtile Kamera-Nahaufnahme, eine geringe Schärfentiefe, warmes, natürliches Licht und eine authentische Café-Atmosphäre. Kein Dialog, keine Musik, keine Schnitte, keine Bildunterschriften, keine sichtbaren Markennamen, keine Logos und kein Wasserzeichen.

T2 · Hochformat-Video

9:16 Test zum Öffnen des Produkts

Bestanden
8,0 statsächliche Dauer
720×1280Entschließung
9:16tatsächliches Verhältnis
25,7 sgesteuerte Laufzeit
Ton vorhandenTitel mit 128 kbps erkannt
~$0.81geschätzte API-Kosten

Das Ergebnis entsprach dem gewünschten Hochformat. Das Etui bleibt zentriert, der Deckel öffnet sich, und beide Ohrhörer bleiben sichtbar. Die Hand bleibt nach dem Öffnen im Bildausschnitt, aber die Produktgeometrie ist stabil, und in den aufgenommenen Bildern sind weder Logo noch Text zu sehen.

Mitnehmen: Gemini Omni Flash kann einen wirklich vertikalen Produktclip liefern, anstatt ein beschnittenes Querformat-Ergebnis zu liefern.

Genaue Eingabeaufforderung anzeigen

Erstellen Sie ein 8 Sekunden langes, vertikales, fotorealistisches Produktvideo im Format 9:16 in einer einzigen durchgehenden Einstellung. Platzieren Sie ein mattes, kobaltblaues Ladecase für kabellose Ohrhörer mittig auf einem sauberen, hellgrauen Studio-Sockel. Eine menschliche Hand taucht vom unteren Bildrand auf, öffnet sanft den Deckel und enthüllt zwei dazu passende blaue Ohrhörer. Gleichzeitig führt die Kamera eine kontrollierte Halbumdrehung von vorne links nach vorne rechts durch, wobei das Etui zentriert und vollständig sichtbar bleibt. Verwenden Sie weiche Studiobeleuchtung im Werbestil, realistische Materialien, stabile Geometrie und präzise Interaktion zwischen Hand und Objekt. Kein Logo, kein Text, keine Schnitte, keine zusätzlichen Objekte, keine verzerrten Finger und kein Wasserzeichen.

T3 · Bild in Video

Konsistenzprüfung anhand eines Referenzbildes

Bestanden
8,0 statsächliche Dauer
1280×720Entschließung
16:9tatsächliches Verhältnis
29,0 sgesteuerte Videolaufzeit
Ton vorhandenTitel mit 128 kbps erkannt
~$0.82Schätzung der Laufzeit des Videos*

Der blaue Körper, der gelbe Griff, der kurze Auslauf, die Steinoberfläche und die sonnendurchflutete Küche bleiben unverändert. Nach dem Eröffnungsbild ist Dampf zu sehen. Das Video verwendet einen etwas breiteren Bildausschnitt als das Ausgangsbild, sodass die Wiedergabe eher originalgetreu als pixelgenau ist.

Mitnehmen: Das Referenzbild ermöglichte eine nützliche Identitätskontrolle, ohne die Szene in einem statischen Bild einzufrieren.

Genaue Animationsanweisung anzeigen

Verwandeln Sie dieses Referenzbild in ein 8 Sekunden langes, fotorealistisches Video im Format 16:9. Behalten Sie dabei den kobaltblauen Körper der Teekanne, den leuchtend gelben Henkel, die Proportionen, die Form des Ausgusses, die Position auf der Tischplatte, die Lichtrichtung und die Gesamtkomposition genau bei. Fügen Sie einen dünnen, realistischen Dampfstrahl hinzu, der aus dem Ausguss aufsteigt, während die Kamera eine langsame, sanfte Drehbewegung um etwa 20 Grad nach rechts ausführt. Halten Sie die Teekanne unverändert und optisch konsistent mit der Vorlage; fügen Sie keine Objekte hinzu, entfernen Sie keine, ändern Sie keine Farben und verändern Sie keine Formen. Kein Text, kein Logo, keine Schnitte, keine Personen und kein Wasserzeichen.

T4 · Zustandsbehaftete Bearbeitung

Weiterverfolgung des Falls „Blau-zu-Rot-Fahrrad“

Bearbeitung fehlgeschlagen
8,0 sBasislaufzeit
1280×720Grundauflösung
16:9Basisverhältnis
29,6 sbasisgesteuerte Laufzeit
52,0 sReaktionszeit bei fehlgeschlagener Bearbeitung
HTTP 502Antwort bearbeiten

Der Basis-Clip zeigt korrekt eine erwachsene Frau in einem gelben Regenmantel neben einem stabilen blauen Fahrrad auf einer nassen Straße. Der Folge-Clip nutzte dieselbe Aufnahmesitzung und zielte auf die im Basisvideo enthaltene Botschaft ab, doch die Bearbeitung lieferte eine 502-Antwort (kein Streaming), keine Medien und kein Nutzungsereignis.

Mitnehmen: Dieser Durchlauf beweist nicht, dass die zustandsbehaftete Bearbeitung zuverlässig funktioniert. Es handelt sich um einen echten Fehlversuch, und die Kontinuität konnte nicht bewertet werden.

Basis- und Folgeanweisungen anzeigen

Aufgabe: Erstellen Sie ein 8 Sekunden langes, fotorealistisches Video im 16:9-Format im Stil eines Kinofilms als eine einzige durchgehende Einstellung. Eine erwachsene Frau in einem leuchtend gelben Regenmantel steht kurz nach einem Regenschauer auf einer nassen Stadtstraße neben einem blauen City-Fahrrad. Sie hält den Lenker leicht fest, während Reflexionen auf dem Asphalt schimmern und einige Regentropfen von einer Markise fallen. Verwende eine langsame seitliche Kamerabewegung, natürliches Licht bei bewölktem Himmel, realistische menschliche Anatomie, stabile Fahrradgeometrie und einheitliche Farben. Keine Dialoge, kein Text, kein Logo, keine Schnitte und kein Wasserzeichen. Folgeaufgabe: Ändere die Farbe des Fahrrads von Blau zu Rot. Behalte alles andere unverändert bei.

T5 · Zeitplanung und Grenzen

10-Sekunden-Test zur Zeitleiste-Steuerung

Größtenteils bestanden
10,0 statsächliche Dauer
1280×720Entschließung
16:9tatsächliches Verhältnis
39,2 sgesteuerte Laufzeit
Ton vorhandenTitel mit 128 kbps erkannt
~$1.02geschätzte API-Kosten
0–3 sKiste geschlossen
3–6 sDer Deckel öffnet sich
6–10 SekundenSterne gehen auf

Beobachtete Grenzproben: Nach 4,0 s war die Box noch geschlossen, nach 4,5 s war der Deckel geöffnet, und nach 6,5 s waren Sterne zu sehen. Die Abfolge war korrekt, aber der erste Übergang setzte später ein als vorgesehen.

Mitnehmen: Das Modell folgte der Reihenfolge der Ereignisse und lieferte die vollen 10 Sekunden als Maximum, doch die Zeitangaben auf der zweiten Ebene waren eher ungefähre Werte und nicht auf den einzelnen Frames genau.

Genaue Eingabeaufforderung anzeigen

Erstellen Sie ein 10 Sekunden langes, fotorealistisches Studio-Video im Format 16:9 in einer einzigen, ununterbrochenen, feststehenden Einstellung. Eine kleine, mattrote Geschenkbox mit einer goldenen Schleife steht mittig auf einer dunklen, neutralen Tischplatte. Halten Sie sich genau an diesen Zeitablauf: [0–3 s] Die Schachtel bleibt vollständig geschlossen und unbewegt; [3–6 s] Der Deckel öffnet sich langsam und sanft von selbst, während die Schachtel an Ort und Stelle bleibt; [6–10 s] Mehrere kleine, metallisch-goldene Papiersterne steigen sanft aus dem Inneren der offenen Schachtel empor und schweben nach oben. Kamera, Hintergrund, Position der Schachtel, Maßstab, Beleuchtung und Objektidentität müssen während der gesamten Aufnahme unverändert bleiben. Keine Personen, kein Text, kein Logo, keine Schnitte, keine zusätzlichen Objekte, keine plötzlichen Bewegungen und kein Wasserzeichen.

Tipps, um die Verschwendung von Credits zu vermeiden

Die Preise für Omni Flash sind niedrig genug, um zum Ausprobieren anzuregen, doch vergebliche Eingabeaufforderungen summieren sich dennoch. Die besten Eingabeaufforderungen sind konkret, ohne dabei überladen zu wirken.

Verwenden Sie eine einzige durchgehende Aufnahme, wenn Sie Stabilität wünschen

Wenn der Clip zusammenhängend wirken soll, sagen Sie “eine einzige durchgehende Einstellung” oder “eine ununterbrochene Kamerabewegung”. Dadurch wird die Wahrscheinlichkeit verringert, dass das Model abrupte Schnitte einbaut oder mitten im Clip das Thema wechselt.

Beschreibe die Kamera, nicht nur das Motiv

Eine Produktbeschreibung sollte sich nicht auf “ein blaues Kopfhöreretui” beschränken. Fügen Sie Bewegung hinzu: “langsame Kamerafahrt um die Hälfte der Umlaufbahn”, “die Hand öffnet das Etui”, “sanfte Spiegelungen im Studio” oder “die Kamera zoomt leicht heran”. Die Bildsprache liefert in der Regel brauchbarere Ergebnisse als das Hinzufügen weiterer Adjektive zum Objekt.

Geben Sie das Seitenverhältnis frühzeitig an

Für mobile Inhalte sollten Sie direkt das Seitenverhältnis 9:16 angeben. Für Website- oder YouTube-Clips verwenden Sie bitte 16:9. Das Seitenverhältnis ist nicht nur eine Frage der Formatierung, sondern bestimmt auch, wie viel Platz dem Model für Hände, Produkte und Bewegungen im Hintergrund zur Verfügung steht.

Bei Bearbeitungen sollten Sie die Änderung auf das Nötigste beschränken

Die zustandsbehaftete Bearbeitung funktioniert am besten, wenn die Folgeanweisung einfach ist: “Ändere die Farbe des Fahrrads von blau auf rot. Alles andere bleibt unverändert.” Vermeiden Sie es, mehrere unabhängige Änderungen auf einmal zu verlangen, es sei denn, Sie sind bereit, die Kosten für Wiederholungsversuche zu tragen.

Verwende für zeitgebundene Aktionen Zeitangaben

Wenn der Clip eine Sequenz enthält, verwende Klammern wie [0–3 s][3–6 s], und [6–10 s]. Dadurch erhält das Modell eine übersichtliche Struktur für das Tempo. Dies garantiert zwar keine frame-genaue Steuerung, ist aber wesentlich übersichtlicher, als das Timing in einem zusammenhängenden Absatz zu beschreiben.

Wer sollte die API, Google Flow oder GlobalGPT nutzen?

Verwenden Sie die Zwillings-API ganz gleich, ob Sie etwas entwickeln, automatisieren oder messen. Die API ist die richtige Wahl, wenn Sie programmatische Steuerung, eine Kostenverfolgung pro Anfrage und wiederholbare Eingabeaufforderungen benötigen.

Verwenden Sie Google Flow im Rahmen eines Google-KI-Plans Wenn Sie bereits die native Kreativumgebung von Google nutzen möchten. Außerdem sind die Tarife „Pro“ und „Ultra“ sinnvoll, wenn das Punktesystem zu Ihrer Arbeitsweise passt und Sie offiziellen Zugriff auf die Verbraucher-Tools wünschen.

Verwenden Sie GlobalGPT Pro wenn Ihr Hauptziel darin besteht, Gemini Omni Flash zusammen mit anderen führenden Modellen zu nutzen, ohne separate Abonnements und API-Konsolen verwalten zu müssen. Der Preis für die Pro-Version beträgt derzeit $10,8 pro Monat bei jährlicher Abrechnung oder $15 pro Monat im Rahmen des monatlichen Sonderangebots. Für viele Nutzer liegt darin der praktische Vorteil: Omni ist in einem umfassenderen Arbeitsbereich verfügbar, in dem Sie auch andere Modelle für das Schreiben, Planen, Recherchieren und kreative Arbeiten vergleichen können.

Wählen Sie GlobalGPT Unlimited falls Ihre Modellnutzung so hoch ist, dass ein größerer Tarif für Sie angenehmer wäre. Der aktuelle Jahrespreis für „Unlimited“ beträgt $25 pro Monat, während das aktuelle Monatsangebot „Unlimited“ für $37 pro Monat anbietet.

Endgültiges Urteil

Gemini Omni Flash ist eines der interessanteren Modelle für Kurzvideos, da es Videogenerierung, Referenzmedien und dialogbasierte Bearbeitung in einem relativ erschwinglichen Paket vereint. Bei etwa $0,10 pro Sekunde für eine 720p-API-Videoausgabe lassen sich die Kosten leicht nachvollziehen. Auch die Einschränkungen sind klar: 3–10 Sekunden, 720p, Vorschaustatus sowie einige technische Einschränkungen hinsichtlich erweiterter Bearbeitungsfunktionen und Parameter.

Wenn Sie Entwickler sind, beginnen Sie mit der Gemini-API und verfolgen Sie die Kosten pro generierter Sekunde. Wenn Sie bereits mit den Kreativ-Tools von Google arbeiten, vergleichen Sie die Tarife des Google AI-Plans anhand der Flow-Credits. Wenn Sie Gemini Omni Flash einfach nutzen möchten, ohne einen API-Workflow aufzubauen, Der Video-Arbeitsbereich von GlobalGPT ist die direktere Option für den Alltag, insbesondere wenn Sie Pro-Zugriff auf andere Modelle im selben Arbeitsbereich wünschen.

FAQ

Ist Gemini Omni Flash kostenlos?

Nein, nicht über die Gemini-API. Google führt Gemini Omni Flash als kostenpflichtiges API-Modell ohne kostenlose API-Stufe auf. Google-KI-Abonnements können zwar Flow-Guthaben enthalten, doch handelt es sich dabei um ein Kontingent im Rahmen eines Verbraucher-Tarifs, das nicht mit einem kostenlosen API-Zugang gleichzusetzen ist.

Wie viel kostet die Gemini Omni Flash API?

Die Preise für die Gemini Omni Flash API betragen $1,50 pro 1 Million Eingabe-Token, $9 pro 1 Million Text-Ausgabe-Token und $17,50 pro 1 Million Video-Ausgabe-Token. Google gibt den Preis für die Videoausgabe für 720p-Videos mit etwa $0,10 pro Sekunde an.

Wie lautet die Modell-ID der Gemini Omni Flash API?

Die API-Modell-ID lautet gemini-omni-flash-Vorschau.

Ist Gemini Omni Flash in Google AI Pro enthalten?

Ja. Der „Google AI Pro“-Tarif kostet $19,99 pro Monat und umfasst 1.000 Flow-Credits mit Omni-Zugang.

Umfasst GlobalGPT auch Gemini Omni Flash?

Ja. GlobalGPT Pro umfasst den Zugang zu Gemini Omni Flash. Der aktuelle Preis für die Pro-Version beträgt $10,8 pro Monat bei jährlicher Abrechnung oder $15 pro Monat im Rahmen der aktuellen monatlichen Sonderaktion.

Was sind die Videobeschränkungen für Gemini Omni Flash?

Die aktuelle API-Vorschau unterstützt die Erstellung von Videos mit einer Länge von 3 bis 10 Sekunden und einer Auflösung von 720p. Standardmäßig wird das Querformat 16:9 verwendet, das Hochformat 9:16 kann angefordert werden.

Kann Gemini Omni Flash Bilder in Videos umwandeln?

Ja. Gemini Omni Flash unterstützt Workflows mit Referenzbildern, sodass Nutzer ein Bild bereitstellen und das Modell anweisen können, anhand dieser visuellen Referenz eine Bewegung zu generieren.

Kann man mit Gemini Omni Flash bereits vorhandene Videos bearbeiten?

Die Dokumentation von Google unterstützt die zustandsbehaftete Nachbearbeitung generierter Videos über die Interactions-API. Bei unserem einzigen praktischen Versuch war das Basisvideo zwar erfolgreich, doch die Nachbearbeitung führte zu einem HTTP-Fehler 502 und es wurden keine bearbeiteten Medien zurückgegeben. Die Funktion sollte daher anhand genau des von Ihnen benötigten Arbeitsablaufs getestet werden, insbesondere solange sich das Modell noch in der Vorschauphase befindet.

Teilen Sie den Beitrag:

Verwandte Beiträge