Wie gut halten sich verschiedene KI-Videomodelle an dieselbe Vorgabe? Dieser Vergleich zur Einhaltung von KI-Video-Anweisungen testet sechs Modelle über GLBGPT: Wan 3.0, Kling 3.0, Seedance 2.5, Grok Imagine, Happy Horse 1.0 und Veo 3.1. Jedes Modell erhält dieselbe Eingabe, sodass Sie sehen können, welches Modell die gewünschten Objekte, Kamerabewegungen, die Reihenfolge der Ereignisse und die Audioanforderungen beibehält.
Jede Hauptkarte verwendet eine festgelegte englische Eingabeaufforderung und mindestens vier Modellausgaben. Die Filmkarte nutzt alle sechs Modelle; die anderen Karten verwenden vier Modelle, die aus demselben Satz von sechs Modellen ausgewählt werden. Wir verwendeten ein 16:9-Bildformat und eine Ausgabeauflösung von 720p und überprüften anschließend die zurückgegebenen Videos und Kontaktabzüge auf sichtbare Abdeckung der Eingabeaufforderung.
Kurze Antwort: Es gibt keinen Gewinner, der bei allen fünf Aufgaben gleichermaßen überzeugt. Wan 3.0 lieferte bei den Bewegungstests die schärfsten Kameraaufnahmen, Kling 3.0 hat das Keramikmuster am wörtlichsten beibehalten, und Seedance 2,5 hielt den filmischen Ablauf – den Spaziergang, die Wendung und die Ankunft der Straßenbahn – in einer klar erkennbaren Reihenfolge fest. Grok Imagine war auf dem Markt für Kameras sehr stark, Happy Horse 1.0 sorgte dafür, dass die Figuren und die Handlungsstränge verständlich blieben, und Veo 3.1 lieferte brauchbare Dateien für die Themen „Film“, „Bewegung“ und „Töpferei“, wobei die zurückgegebenen Dauerangaben bei den beiden letztgenannten Themen kürzer ausfielen.

Was versteht man unter der Einhaltung von KI-Video-Vorgaben?
Die Genauigkeit der Umsetzung gibt an, inwieweit ein generiertes Video die Details Ihrer Anfrage wiedergibt. Wir haben benannte Objekte, Farben und Muster, Kamerabewegungen, die Reihenfolge der Ereignisse, die Kontinuität der Figuren sowie Vorgaben hinsichtlich Ton und Dialogen überprüft.
Ein Clip kann professionell wirken und dennoch die Vorgabe verfehlen. Er zeigt vielleicht überzeugend Regen, lässt aber die Straßenbahn außer Acht, verwandelt eine schmale weiße Welle in ein anderes Muster, verändert das Gesicht des Schauspielers oder endet vor dem letzten Handlungshöhepunkt. Jede Karte zeigt daher neben den Modellausgaben und den festgestellten Abweichungen den genauen Schwerpunkt der Vorgabe.
Die sechs Modelle in diesem Vergleich
In diesem Artikel wird für alle sechs Modelle dieselbe Zugangsbezeichnung verwendet: GLBGPT. Die Tabelle enthält das gesamte Sortiment; es gibt keinen separaten Modellabschnitt, in dem nur zwei Anbieter vorgestellt werden.
| Modell | Zugang | Umfassende Berichterstattung in diesem Vergleich | Was die Karten prüfen |
|---|---|---|---|
| Wan 3.0 | GLBGPT | Alle fünf Aufgabenstellungen | Kamerabewegungen, Figuren, Bewegung, Ton, Reihenfolge der Handlungsstränge |
| Kling 3.0 | GLBGPT | Alle fünf Aufgabenstellungen | Kamerabewegungen, Figuren, Bewegung, Ton, Reihenfolge der Handlungsstränge |
| Seedance 2,5 | GLBGPT | Filmische Gestaltung, Figuren, Dialoge | Ablauf der Handlung, Charakterbeschreibung, Dialogszenen |
| Grok Imagine | GLBGPT | Filmische Darstellung, Bewegung, Dialog | Kamerabewegung, Erfassung der Handlung, Szene mit zwei Sprechern |
| Happy Horse 1.0 | GLBGPT | Film, Figur, Töpferei | Charakterkontinuität und dreiteilige Erzählstruktur |
| Veo 3.1 | GLBGPT | Filmische Anfrage, Bewegung, Töpferei | Routenauswahl, Kamerabewegungen, Handlungsschritte |
So haben wir die sechs Modelle getestet
Wir haben fünf Prompts eingefroren, bevor wir die Ergebnisse verglichen haben. Das Modell wechselte von Karte zu Karte, während der Prompt, das Seitenverhältnis, die Auflösung, die Dauer und die Audioeinstellungen innerhalb jeder Karte gleich blieben. Eine typische GLBGPT-Anfrage sah wie folgt aus:
{
"surface": "GLBGPT",
"model": "seedance-2.5",
"prompt": "die identische Test-Eingabeaufforderung",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": 5,
"audio": false
}
| Eingabeaufforderung | Modelle im Vergleich auf derselben Karte | Feste Einstellungen |
|---|---|---|
| Filmische Text-zu-Video-Umwandlung | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine · Happy Horse 1.0 · Veo 3.1 | 5 Sekunden · 720p · 16:9 · ohne Ton |
| Konsistenz der Zeichen | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Happy Horse 1.0 | 5 Sekunden · 720p · 16:9 · ohne Ton |
| Komplexe Bewegungs- und Kamerasteuerung | Wan 3.0 · Kling 3.0 · Grok Imagine · Veo 3.1 | 5 Sekunden · 720p · 16:9 · ohne Ton |
| Dialoge und Original-Tonspur | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine | 5 Sekunden · 720p · 16:9 · Original-Tonspur gewünscht |
| Die Geschichte der „Three-Beat“-Keramik | Wan 3.0 · Kling 3.0 · Happy Horse 1.0 · Veo 3.1 | 15 Sekunden · 720p · 16:9 · Original-Ton erwünscht |
Testkarten zur Überprüfung der Einhaltung von Anweisungen in sechs verschiedenen Modellen
TESTS ABGESCHLOSSEN Die folgenden fünf Prompts halten jeden Vergleich zusammen. Jeder Prompt verfügt über mindestens vier Modelle; der erste filmische Prompt umfasst alle sechs. Die zurückgemeldete Dauer wird anhand der jeweiligen lokalen MP4-Datei gemessen, sodass eine Route, die vorzeitig endet, als „zurückgemeldet“ beschrieben wird und nicht als versteckter Qualitätswert behandelt wird.
Aufgabe 1 · sechs Modelle · 5 Sekunden · 720p · 16:9
Filmische Text-zu-Video-Umwandlung
Aufforderung: Eine filmische Kamerafahrt folgt einer Frau in einem langen roten Mantel, die nachts durch eine regennasse, von Neonlicht erhellte Straße geht. Sie dreht sich zur Kamera um, während hinter ihr eine Straßenbahn vorbeifährt, deren Spiegelungen sich natürlich über den nassen Asphalt bewegen. Realistische menschliche Bewegungen, stimmige Gesichts- und Kleidungsdarstellung, geringe Schärfentiefe, kontrollierte Handkameraführung, keine Schnitte.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2,5 GLBGPT
Grok Imagine GLBGPT
Happy Horse 1.0 GLBGPT
Veo 3.1 GLBGPT · 5,04 s
- Wan: folgt der Frau, zeigt die Drehung und führt die Straßenbahn durch den Hintergrund.
- Kling: Die Beleuchtung bei Regen wirkt weiterhin reizvoll, doch das Motiv ist vergleichsweise statisch.
- Seedance 2.5: behält die Reihenfolge von Rückansicht beim Gehen, sichtbarer Abbiegung und Ankunft der Straßenbahn in der gewünschten Reihenfolge bei.
- Grok: Beibehaltung des roten Mantels, des Regens, der neonbeleuchteten Straße und der Straßenbahn, wobei die Straßenbahn deutlich hinter der Hauptfigur vorbeifährt.
- Happy Horse: Die Kamera beginnt hinter der Frau und zeigt dann die Kurve und die Straßenbahn mit einer Nahaufnahme des Gesichts.
- Veo: Behält den roten Mantel und die Straßenbahnkarte bei, doch die Kameraführung ist statischer als bei den Versionen „Wan“ und „Seedance“.
Aufgabenbeobachtung: Seedance 2.5 weist die deutlichste Übereinstimmung bei der Abfolge der Ereignisse auf; Wan bietet bei dieser Karte mit sechs Modellen die umfassendste Kamera-/Aktionsabdeckung.
Aufgabe 2 · vier Modelle · 5 Sekunden · 720p · 16:9
Konsistenz der Figuren ohne Referenzbild
Aufforderung: Eine einzige, durchgehende Einstellung desselben älteren Uhrmachers mit runder silberner Brille, einer grünen Weste und einer kleinen Narbe über der linken Augenbraue. Er nimmt eine Taschenuhr in die Hand, geht von seiner Werkbank zum Fenster, dreht sich im Profil zur Seite und blickt dann wieder in die Kamera. Sein Gesicht, seine Brille, seine Kleidung, sein Alter und seine Narbe bleiben dabei unverändert.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2,5 GLBGPT
Happy Horse 1.0 GLBGPT
- Wan und Kling: Der Uhrmacher bleibt zwar erkennbar, doch die Narbe an der Augenbraue ist bei keiner der beiden Darstellungen deutlich zu erkennen.
- Seedance 2.5: Der ältere Uhrmacher, die Brille, die Weste und die Bewegung vom Arbeitstisch zum Fenster sind erhalten geblieben; die Narbe ist nicht deutlich zu erkennen.
- Happy Horse: Behält die Brille und die Weste bei der Bewegung von der Seitenansicht zur Vorderansicht bei; auch die charakteristische Narbe ist nicht deutlich zu erkennen.
Aufgabenbeobachtung: Alle vier Modelle bewahren die Hauptidentität besser als die kleinsten Gesichtsdetails; es wurde kein Sieger auf Modellebene ermittelt.
Aufgabe 3 · vier Modelle · 5 Sekunden · 720p · 16:9
Komplexe Bewegungs- und Kamerasteuerung
Aufforderung: Ein Radfahrer rast bergab durch einen belebten mediterranen Markt, während die Kamera zunächst mit einer Frontal-Kamerafahrt aus niedriger Perspektive beginnt, sanft nach links schwenkt und sich dann zu einer Weitwinkelaufnahme aus der Vogelperspektive erhebt. Verkäufer treten beiseite, Stoffmarkisen wehen im Wind, Orangen rollen aus einem umgestürzten Korb, und jedes Ereignis vollzieht sich in dieser Reihenfolge mit realistischer Physik.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Grok Imagine GLBGPT
Veo 3.1 GLBGPT
- Wan: zeigt die deutlichste Vorwärtsbewegung und geht in eine Draufsicht über.
- Kling: zeigt den gekippten Korb und die rollenden Orangen deutlicher.
- Grok: führt eine gut sichtbare Bewegung von vorne über die Seite bis nach oben aus und sorgt dafür, dass die Orangen im Blick bleiben.
- Veo: behält den Radfahrer und den Markt bei, lässt jedoch die Markisen in den späteren Bildern dominieren; die vollständige Abfolge der Ereignisse ist weniger klar.
Aufgabenbeobachtung: Wan und Grok weisen die stärkste Abdeckung des Kamerabahns auf; Kling ist bei den orangefarbenen Details am stärksten.
Aufgabe 4 · vier Modelle · 5 Sekunden · 720p · Original-Ton gewünscht
Dialoge und Original-Tonspur
Aufforderung: In einem ruhigen Zugabteil sagt eine Frau: “Wir haben die letzte Haltestelle verpasst.” Ein Mann ihr gegenüber antwortet: “Dann fahren wir eben bis zum Endbahnhof.” Die beiden Stimmen müssen klar voneinander unterscheidbar sein, jede Zeile muss dem jeweiligen Sprecher zugeordnet sein, es sollten dezente Zuggeräusche und Radgeräusche zu hören sein, und es darf keine Musik hinzugefügt werden.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2,5 GLBGPT
Grok Imagine GLBGPT
- In allen vier Szenen waren Zugabteile mit zwei sichtbaren Sprechern zu sehen.
- Wan und Kling lieferten in den gespeicherten Aufzeichnungen 5,04 Sekunden lange Stereo-AAC-Spuren; die neuen Seedance- und Grok-Dateien wurden auf Szenenabdeckung überprüft, doch die genaue Zuordnung von gesprochenem Wort und Sprecher erfordert noch einen kontrollierten Hördurchlauf.
- Seedance zeigt die Frau und den Mann in getrennten Einstellungen; Grok zeigt beide Sprecher in den meisten Bildern im selben Zugabteil.
Aufgabenbeurteilung: Es wird erst dann ein Gewinner ermittelt, wenn alle vier Tonaufnahmen transkribiert und nach demselben Bewertungsprotokoll angehört wurden.
Aufgabe 5 · vier Modelle · 15 s · 720p · Original-Tonaufnahme erwünscht
Die Geschichte der „Matched Three-Beat“-Keramik
Aufforderung: Erstellen Sie eine zusammenhängende, 15 Sekunden lange filmische Geschichte in drei aufeinanderfolgenden Szenen: In einer gemütlichen Töpferwerkstatt formt ein erwachsener Töpfer in einer rostfarbenen Schürze auf einer Töpferscheibe eine hohe blaue Vase; derselbe Töpfer malt sorgfältig ein feines weißes Wellenmuster um dieselbe Vase; die fertige Vase steht auf einem Holztisch neben einer kleinen grünen Pflanze, während der Töpfer im Hintergrund lächelt. Behalten Sie durchgehend denselben erwachsenen Töpfer, die rostfarbene Schürze, die blaue Vase, das Atelier und die warme Beleuchtung bei. Verwenden Sie natürliche Szenenübergänge, realistische Handbewegungen, leise Geräusche der Töpferscheibe und des Pinsels sowie keine Erzählstimme oder Musik.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Happy Horse 1.0 GLBGPT
Veo 3.1 GLBGPT
- Wan: vollendet die Formgebung, die Bemalung und die Präsentation, erweitert jedoch die gewünschte schmale Welle zu einem breiteren dekorativen Muster.
- Kling: behält die markante weiße Welle und die rostfarbene Schürze wörtlicher bei.
- Happy Horse: Behält die blaue Vase, die weiße Welle und die abschließende Pflanzenarrangement bei; der handwerklich gestaltete Rahmen wechselt zwischen den Takten.
- Veo: vervollständigt den Arbeitsablauf bei der Vasengestaltung und die endgültige Präsentation mit einer sichtbaren Welle und einer Pflanze; die Kontinuität der Identität ist weniger stabil als die Kontinuität des Objekts.
Aufgabenbeobachtung: Kling sticht bei den Details der „White Wave“ am deutlichsten hervor; „Happy Horse“ und Veo decken die drei Handlungsschritte klar ab.
Welches Modell sollten Sie wählen?
Entscheiden Sie sich für Wan 3.0, wenn:
- Einfallsreiche Kameraführung
- Umfassendere Berichterstattung
- Ein guter Ausgangspunkt für bewegungsintensive Prompts
Wählen Sie Kling 3.0 für:
- Wörtliche visuelle Details und Muster
- Arbeitsabläufe für Charakterdialoge und Lippensynchronisation
- Kompakte Mehrfachaufnahmen
Wählen Sie Seedance 2.5 für:
- Geordnete filmische Ereignisse
- Eine sichtbare Wendung und Hintergrundhandlung in einem kurzen Abschnitt
- Aufgaben, bei denen die Reihenfolge der Ereignisse wichtiger ist als eine allgemeine Punktzahl
Probieren Sie Grok, Happy Horse oder Veo aus, wenn:
- Sie wünschen eine zweite Auswertung der Kameraaufnahmen
- Dir liegen gut lesbare Handlungsabschnitte und eine umfassende Berichterstattung am Herzen
- Sie können die genaue Eingabeaufforderung vor der Produktionsumgebung testen.
Für diesen Vergleich wurden alle sechs Modelle über GLBGPT aufgerufen. Führen Sie Ihre eigene Eingabeaufforderung im selben Arbeitsbereich aus, vergleichen Sie die zurückgegebenen Karten und wählen Sie den Weg, der die Details bewahrt, die Ihr Projekt tatsächlich benötigt.
Endgültiges Urteil zur Einhaltung der Anweisungen
Es gibt keinen universellen Modellsieger. Dieser Test mit sechs Modellen ermittelt die Sieger auf Aufgabenebene: Wan 3.0 für die Kameraführung, Kling 3.0 für das wörtliche Töpfermuster und Seedance 2,5 für die Abfolge der Ereignisse im filmischen Briefing. Grok Imagine bewältigte den Kameravorgang auf dem Markt gut, Happy Horse 1.0 sorgte dafür, dass die Charakter- und Keramik-Elemente gut erkennbar blieben, und Veo 3.1 lieferte bei den verschiedenen Vorgaben gemischte Ergebnisse. Diese Ergebnisse beziehen sich auf die genannten Vorgaben und Durchläufe, nicht auf jede mögliche Video-Aufgabe.
Häufig gestellte Fragen
Welche sechs KI-Videomodelle haben Sie getestet?
Wir haben Wan 3.0, Kling 3.0, Seedance 2.5, Grok Imagine, Happy Horse 1.0 und Veo 3.1 mit GLBGPT getestet.
Wurden bei jeder Eingabe mehr als ein Modell verwendet?
Ja. Jede Haupt-Prompt-Karte enthält mindestens vier Modelle, und die Filmkarte enthält alle sechs. So bleibt jeder Prompt die Vergleichseinheit, anstatt einem Modell einen eigenen Prompt zuzuweisen.
Welches Modell hat die Reihenfolge der filmischen Ereignisse am besten wiedergegeben?
Seedance 2.5 hielt in diesem Durchlauf die Abfolge „Gang in roter Uniform, Drehung zur Kamera und Ankunft des Trams“ in der gewünschten Reihenfolge am deutlichsten ein. Wan 3.0 zeigte in der gepaarten filmischen Umsetzung eine stärkere Abdeckung der Kamera und der Handlung.
Welches Modell hat die feinen visuellen Details am besten wiedergegeben?
Kling 3.0 hat die dünne weiße Welle aus der Keramikgeschichte am wörtlichsten wiedergegeben. Das Ergebnis ist eine Beobachtung auf Aufgabenebene, daher sollten ein Logo, ein Kostüm oder eine Strichzeichnung weiterhin direkt getestet werden.
Wie hat sich Veo 3.1 in dieser Matrix geschlagen?
Veo 3.1 lieferte eine brauchbare Filmdatei und schloss die sichtbaren Bewegungs- und Töpfer-Sequenzen ab, doch die Bewegungsdatei war etwa vier Sekunden lang und die Töpferdatei etwa acht Sekunden, obwohl längere Laufzeiten angefordert worden waren. Diese kürzeren Ergebnisse werden als Ausführungsdetails erfasst und nicht in eine allgemeine Qualitätsbewertung umgerechnet.
Dürfen diese Videos kommerziell genutzt werden?
Die Rechte zur kommerziellen Nutzung hängen vom aktuellen Tarif und den für den Zugangsweg geltenden Bedingungen ab. Bitte überprüfen Sie die aktuellen Bedingungen, bevor Sie bezahlte Kundenaufträge oder Werbematerialien veröffentlichen.
Quellen und Testnachweise
- Vergleich der Einhaltung von Anweisungen in Higgsfield — Hinweis auf die Idee des Vergleichs anhand derselben Eingabeaufforderung.
- GLBGPT-Aufgabenprotokolle und lokale MP4-Ausgaben – Fünf-Prompt-Matrix, 720p, 16:9, mit den auf jeder Karte angezeigten Einstellungen.
- Lokale Kontaktabzüge – dienen zur Überprüfung der Abfolge der Ereignisse, der Kontinuität der Objekte, der Kamerabewegungen und der sichtbaren Details in den zurückgesendeten Clips.



