Seberapa baik berbagai model video AI mengikuti prompt yang sama? Perbandingan kepatuhan terhadap prompt video AI ini menguji enam model melalui GLBGPT: Wan 3.0, Kling 3.0, Seedance 2.5, Grok Imagine, Happy Horse 1.0, dan Veo 3.1. Setiap model menerima prompt yang sama sehingga Anda dapat melihat model mana yang mempertahankan objek yang diminta, pergerakan kamera, urutan peristiwa, dan persyaratan audio.
Setiap kartu utama menggunakan satu prompt bahasa Inggris yang tetap dan setidaknya empat hasil keluaran model. Kartu sinematik menggunakan keenam model tersebut; sedangkan kartu-kartu lainnya menggunakan empat model yang dipilih dari kumpulan enam model yang sama. Kami menggunakan rasio aspek 16:9 dan resolusi keluaran 720p, kemudian memeriksa video yang dihasilkan serta lembar kontak untuk memastikan cakupan prompt yang terlihat.
Jawaban singkat: Tidak ada pemenang yang sama untuk kelima soal tersebut. Wan 3.0 menghasilkan rekaman kamera yang paling jernih dalam uji gerakan, Kling 3.0 mempertahankan pola tembikarnya secara paling harfiah, dan Seedance 2,5 menjaga urutan adegan berjalan, berbalik, dan kedatangan trem dalam urutan yang paling jelas. Grok Bayangkan memiliki posisi yang kuat di segmen kamera pasar, Happy Horse 1.0 membuat karakter dan alur cerita tetap mudah diikuti, dan Veo 3.1 menghasilkan berkas-berkas yang dapat digunakan untuk prompt sinematik, gerak, dan keramik, dengan durasi hasil yang lebih pendek pada dua prompt terakhir.

Apa Itu Kepatuhan terhadap Prompt Video AI?
Kepatuhan terhadap prompt adalah sejauh mana video yang dihasilkan mempertahankan detail-detail dalam permintaan Anda. Kami memeriksa objek-objek yang disebutkan, warna dan pola, pergerakan kamera, urutan peristiwa, konsistensi karakter, serta batasan audio atau dialog.
Sebuah klip bisa terlihat rapi namun tetap melenceng dari petunjuk. Klip tersebut mungkin menampilkan adegan hujan yang meyakinkan, tetapi kehilangan adegan trem, mengubah gelombang putih tipis menjadi pola yang berbeda, mengubah wajah aktor, atau berhenti sebelum adegan klimaks cerita. Oleh karena itu, setiap kartu menampilkan fokus petunjuk yang tepat di samping hasil model dan kesalahan yang teramati.
Enam Model dalam Perbandingan Ini
Keenam model tersebut menggunakan label akses yang sama dalam artikel ini: GLBGPT. Tabel tersebut memuat daftar lengkap; tidak ada bagian model terpisah yang hanya memperkenalkan dua penyedia layanan.
| Model | Akses | Cakupan yang cepat dalam perbandingan ini | Apa yang diuji dalam tes kartu ini |
|---|---|---|---|
| Wan 3.0 | GLBGPT | Kelima petunjuk tersebut | Gerakan kamera, karakter, gerakan, audio, urutan cerita |
| Kling 3.0 | GLBGPT | Kelima petunjuk tersebut | Gerakan kamera, karakter, gerakan, audio, urutan cerita |
| Seedance 2,5 | GLBGPT | Sinematografi, karakter, dialog | Urutan peristiwa, detail karakter, adegan dialog |
| Grok Bayangkan | GLBGPT | Sinematik, gerakan, dialog | Jalur kamera, cakupan aksi, adegan dengan dua pembicara |
| Happy Horse 1.0 | GLBGPT | Sinematik, karakter, tembikar | Konsistensi karakter dan cakupan cerita tiga fase |
| Veo 3.1 | GLBGPT | Permohonan terkait sinematografi, gerak, dan keramik | Persetujuan rute, pergerakan kamera, titik-titik penting alur cerita |
Bagaimana Kami Menguji Enam Model Tersebut
Kami membekukan lima prompt sebelum membandingkan hasilnya. Modelnya berbeda-beda di setiap kartu, sedangkan prompt, rasio aspek, resolusi, durasi, dan pengaturan audio tetap sama di dalam setiap kartu. Contoh bentuk permintaan GLBGPT yang representatif adalah:
{
"permukaan": "GLBGPT",
"model": "seedance-2.5",
"prompt": "prompt uji yang sama",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": 5,
"audio": false
}
| Cepat | Model-model yang dibandingkan dalam kartu yang sama | Pengaturan tetap |
|---|---|---|
| Konversi teks menjadi video bergaya sinematik | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine · Happy Horse 1.0 · Veo 3.1 | 5 detik · 720p · 16:9 · tanpa audio |
| Konsistensi karakter | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Happy Horse 1.0 | 5 detik · 720p · 16:9 · tanpa audio |
| Gerakan kompleks dan pengendalian kamera | Wan 3.0 · Kling 3.0 · Grok Imagine · Veo 3.1 | 5 detik · 720p · 16:9 · tanpa audio |
| Dialog dan audio asli | Wan 3.0 · Kling 3.0 · Seedance 2,5 · Grok Bayangkan | 5 detik · 720p · 16:9 · diminta menggunakan audio asli |
| Kisah tembikar tiga irama | Wan 3.0 · Kling 3.0 · Happy Horse 1.0 · Veo 3.1 | 15 detik · 720p · 16:9 · diminta menggunakan audio asli |
Kartu Uji Kepatuhan dengan Enam Model Prompt
PENGUJIAN TELAH SELESAI Lima prompt di bawah ini mengelompokkan setiap perbandingan secara terpisah. Setiap prompt memiliki setidaknya empat model; prompt sinematik pertama memiliki keenam model tersebut. Durasi yang dilaporkan diukur berdasarkan setiap file MP4 lokal, sehingga rute yang berakhir lebih awal dinyatakan sebagai “dilaporkan” alih-alih dianggap sebagai skor kualitas tersembunyi.
Prompt 1 · enam model · 5 detik · 720p · 16:9
Konversi Teks ke Video Bergaya Sinematik
Cepat: Sebuah adegan tracking shot bergaya sinematik mengikuti seorang wanita yang mengenakan mantel merah panjang saat berjalan melintasi jalanan yang dipenuhi lampu neon dan basah kuyup oleh hujan di malam hari. Ia menoleh ke arah kamera saat sebuah trem melintas di belakangnya, sementara pantulan cahaya bergerak secara alami di atas trotoar yang basah. Gerakan manusia yang realistis, wajah dan pakaian yang konsisten, kedalaman bidang yang dangkal, pengambilan gambar dengan kamera genggam yang terkendali, tanpa potongan adegan.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2,5 GLBGPT
Grok Bayangkan GLBGPT
Happy Horse 1.0 GLBGPT
Veo 3.1 GLBGPT · 5,04 detik
- Wan: mengikuti wanita itu, memperlihatkan belokan, dan membawa trem melintasi latar belakang.
- Kling: Tetap menampilkan pencahayaan saat hujan yang menarik, namun objeknya relatif statis.
- Seedance 2,5: menjaga agar adegan berjalan dari belakang, belokan yang terlihat, dan kedatangan trem tetap dalam urutan yang diminta.
- Grok: masih memperlihatkan mantel merah, hujan, jalanan bercahaya neon, dan trem, dengan trem tersebut terlihat jelas melintas di belakang subjek.
- Happy Horse: Awalnya kamera berada di belakang wanita tersebut, lalu memperlihatkan adegan belokan dan trem dengan bidikan wajah yang lebih dekat.
- Veo: Masih menggunakan mantel merah dan kartu tiket trem, tetapi kamera ini lebih statis dibandingkan rekaman dari Wan dan Seedance.
Pengamatan tugas: Seedance 2.5 menunjukkan kesesuaian urutan peristiwa yang paling jelas; Wan memiliki cakupan kamera/aksi yang paling baik di antara keenam model ini.
Prompt 2 · empat model · 5 detik · 720p · 16:9
Konsistensi Karakter Tanpa Gambar Referensi
Cepat: Sebuah adegan tanpa potongan yang menampilkan seorang pembuat jam tua yang sama, dengan kacamata perak bulat, rompi hijau, dan bekas luka kecil di atas alis kirinya. Ia mengambil sebuah jam saku, berjalan dari meja kerjanya menuju jendela, berbalik sehingga hanya terlihat profilnya, lalu kembali menghadap kamera. Wajah, kacamata, pakaian, usia, dan bekas lukanya harus tetap sama sepanjang adegan.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2,5 GLBGPT
Happy Horse 1.0 GLBGPT
- Wan dan Kling: membuat sosok pembuat jam itu tetap dapat dikenali, namun tidak ada yang secara jelas mempertahankan bekas luka di alisnya.
- Seedance 2,5: menjaga kondisi pembuat jam tua, kacamata, rompi, dan pergerakan dari meja kerja ke jendela; bekas lukanya tidak terlihat jelas.
- Happy Horse: tetap mengenakan kacamata dan rompi selama gerakan dari samping ke depan; bekas luka yang menjadi ciri khasnya juga tidak terlihat jelas.
Pengamatan tugas: keempat model tersebut mempertahankan identitas utama dengan lebih baik daripada detail wajah terkecil; tidak ada pemenang yang ditetapkan pada tingkat model.
Prompt 3 · empat model · 5 detik · 720p · 16:9
Gerakan Kompleks dan Pengendalian Kamera
Cepat: Seorang pengendara sepeda melaju menuruni bukit melintasi pasar Mediterania yang ramai, sementara kamera memulai adegan dengan pengambilan gambar dari sudut rendah yang mengikuti pergerakan dari depan, berbelok dengan mulus ke sisi kirinya, lalu naik ke sudut pandang luas dari atas. Para pedagang menyingkir, kanopi kain berkibar tertiup angin, jeruk-jeruk berguling dari keranjang yang terbalik, dan setiap peristiwa terjadi dalam urutan tersebut dengan fisika yang realistis.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Grok Bayangkan GLBGPT
Veo 3.1 GLBGPT
- Wan: menampilkan gerakan pelacakan depan yang paling jelas dan beralih ke sudut pandang dari atas.
- Kling: menampilkan keranjang yang miring dan jeruk-jeruk yang berguling dengan lebih jelas.
- Grok: melakukan gerakan yang mudah diamati—dari depan ke samping lalu ke atas—dan memastikan jeruk-jeruk itu tetap terlihat.
- Veo: tetap menonjolkan sosok pengendara sepeda dan pasar, namun membiarkan kanopi mendominasi bingkai-bingkai pada bagian akhir; urutan peristiwa secara keseluruhan kurang jelas.
Pengamatan tugas: Wan dan Grok menunjukkan cakupan jalur kamera yang paling luas; Kling paling unggul dalam menampilkan detail berwarna oranye.
Prompt 4 · empat model · 5 detik · 720p · diminta menggunakan audio asli
Dialog dan Audio Asli
Cepat: Di dalam gerbong kereta yang sunyi, seorang wanita berkata, “Kita melewatkan perhentian terakhir.” Seorang pria di seberangnya menjawab, “Kalau begitu, kita lanjut sampai ujung.” Pastikan kedua suara tersebut terdengar berbeda, sesuaikan setiap dialog dengan pembicara yang tepat, sertakan suara latar kereta dan suara roda yang halus, serta jangan tambahkan musik.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2,5 GLBGPT
Grok Bayangkan GLBGPT
- Keempat adegan di dalam gerbong kereta tersebut menampilkan dua orang yang sedang berbicara.
- Wan dan Kling menghasilkan trek AAC stereo berdurasi 5,04 detik dalam catatan yang disimpan; berkas-berkas baru Seedance dan Grok telah diperiksa terkait cakupan adegan, namun penentuan tepat kata-kata yang diucapkan dan penugasan pembicara masih memerlukan sesi pendengaran terkontrol.
- Seedance menampilkan sang wanita dan sang pria dalam sudut pandang yang terpisah; Grok menampilkan kedua pembicara dalam komposisi kereta yang sama pada sebagian besar bingkai.
Pengamatan tugas: pemenang belum akan ditentukan sampai keempat rekaman audio tersebut ditranskripsikan dan didengarkan sesuai dengan protokol peninjauan yang sama.
Prompt 5 · empat model · 15 detik · 720p · diminta menggunakan audio asli
Kisah Tembikar Tiga Irama yang Serasi
Cepat: Ciptakan sebuah kisah sinematik yang koheren berdurasi 15 detik dalam tiga adegan yang saling terkait: di sebuah studio tembikar yang hangat, seorang pengrajin dewasa yang mengenakan celemek berwarna karat sedang membentuk vas biru tinggi di atas roda tembikar; pengrajin yang sama dengan hati-hati melukis pola gelombang putih tipis di sekeliling vas yang sama; vas yang sudah jadi itu berdiri di atas meja kayu di samping tanaman hijau kecil sementara sang pengrajin tersenyum di latar belakang. Pertahankan pengrajin dewasa yang sama, celemek berwarna karat, vas biru, studio, dan pencahayaan yang hangat sepanjang video. Gunakan transisi adegan yang alami, gerakan tangan yang realistis, suara roda tembikar dan kuas yang lembut, serta tanpa narasi atau musik.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Happy Horse 1.0 GLBGPT
Veo 3.1 GLBGPT
- Wan: selesai dalam proses pembentukan, pengecatan, dan penataan, namun memperluas pola gelombang tipis yang diminta menjadi pola dekoratif yang lebih lebar.
- Kling: mempertahankan bentuk gelombang putih yang mudah dikenali dan bagian bawah berwarna karat secara lebih harfiah.
- Happy Horse: mempertahankan vas biru, gelombang putih, dan tampilan tanaman terakhir; bingkai buatan pengrajin berubah di antara setiap ketukan.
- Veo: melengkapi alur kerja pembuatan vas dan tampilan akhirnya dengan gelombang yang terlihat serta tanaman; kontinuitas identitas kurang stabil dibandingkan dengan kontinuitas objek.
Pengamatan tugas: Kling paling unggul dalam menampilkan detail gelombang putih secara harfiah; Happy Horse dan Veo berhasil menggambarkan tiga titik balik cerita dengan jelas.
Model Mana yang Harus Anda Pilih?
Pilih Wan 3.0 untuk:
- Gerakan kamera yang ambisius
- Liputan berita yang lebih mendalam
- Titik awal yang kuat untuk prompt yang sarat dengan gerakan
Pilih Kling 3.0 untuk:
- Detail dan pola visual yang harfiah
- Alur kerja dialog karakter dan sinkronisasi bibir
- Adegan multi-shot yang ringkas
Pilih Seedance 2.5 untuk:
- Rangkaian peristiwa sinematik
- Sebuah perubahan yang jelas dan aksi di latar belakang dalam satu adegan singkat
- Prompt di mana urutan peristiwa lebih penting daripada skor keseluruhan
Cobalah Grok, Happy Horse, atau Veo jika:
- Anda ingin interpretasi kamera yang kedua
- Anda mengutamakan alur cerita yang mudah dipahami dan liputan yang menyeluruh
- Anda dapat menguji prompt yang tepat sebelum diluncurkan
Keenam model tersebut diakses melalui GLBGPT untuk perbandingan ini. Jalankan prompt Anda sendiri di ruang kerja yang sama, bandingkan hasil yang ditampilkan, dan pilih opsi yang mempertahankan detail yang benar-benar dibutuhkan oleh proyek Anda.
Keputusan Akhir Mengenai Kepatuhan terhadap Petunjuk
Tidak ada model pemenang yang universal. Uji coba enam model ini menghasilkan pemenang di tingkat tugas: Wan 3.0 untuk cakupan kamera, Kling 3.0 untuk pola tembikar secara harfiah, dan Seedance 2.5 untuk urutan peristiwa dalam brief sinematik. Grok Imagine menangani jalur kamera pasar dengan baik, Happy Horse 1.0 memastikan alur karakter dan keramik tetap mudah dipahami, sedangkan Veo 3.1 menghasilkan hasil eksekusi yang bervariasi di berbagai prompt. Temuan-temuan ini menggambarkan prompt dan eksekusi tersebut, bukan setiap skenario video yang mungkin.
Pertanyaan yang Sering Diajukan
Enam model video AI mana saja yang sudah Anda uji?
Kami telah menguji Wan 3.0, Kling 3.0, Seedance 2.5, Grok Imagine, Happy Horse 1.0, dan Veo 3.1 melalui GLBGPT.
Apakah setiap prompt menggunakan lebih dari satu model?
Ya. Setiap kartu prompt utama berisi setidaknya empat model, sedangkan kartu sinematik berisi keenam model tersebut. Hal ini memastikan bahwa setiap prompt tetap menjadi satuan perbandingan, alih-alih memberikan prompt terpisah untuk satu model.
Model mana yang paling tepat mengikuti urutan peristiwa dalam film tersebut?
Seedance 2.5 mempertahankan urutan yang diminta dengan paling jelas dalam adegan ini, yaitu langkah dengan mantel merah, berbalik menghadap kamera, dan kedatangan trem. Wan 3.0 menampilkan cakupan kamera dan aksi yang lebih baik dalam hasil sinematik berpasangan tersebut.
Model mana yang paling baik dalam mempertahankan detail visual yang halus?
Kling 3.0 menampilkan gelombang putih tipis dalam cerita tembikar tersebut secara paling harfiah. Hasil ini merupakan pengamatan pada tingkat tugas, sehingga prompt berupa logo, kostum, atau gambar garis tetap harus diuji secara langsung.
Bagaimana kinerja Veo 3.1 dalam matriks ini?
Veo 3.1 menghasilkan berkas sinematik yang dapat digunakan dan menyelesaikan adegan gerakan serta adegan keramik yang terlihat, namun durasi berkas gerakan hanya sekitar empat detik dan berkas keramik sekitar delapan detik, meskipun yang diminta adalah durasi yang lebih panjang. Hasil yang lebih singkat tersebut dicatat sebagai rincian pelaksanaan, bukan dikonversi menjadi skor kualitas universal.
Apakah video-video ini boleh digunakan untuk tujuan komersial?
Hak penggunaan komersial bergantung pada paket yang sedang berlaku dan ketentuan yang berlaku untuk jalur akses tersebut. Periksa ketentuan terkini sebelum mempublikasikan hasil kerja klien berbayar atau materi iklan.
Sumber dan Bukti Uji
- Perbandingan kepatuhan terhadap petunjuk di Higgsfield — referensi untuk gagasan perbandingan dengan prompt yang sama.
- Catatan tugas GLBGPT dan hasil keluaran MP4 lokal — matriks lima prompt, 720p, 16:9, dengan pengaturan yang ditampilkan pada setiap kartu.
- Lembar kontak lokal — digunakan untuk memeriksa urutan peristiwa, kesinambungan objek, pergerakan kamera, dan detail yang terlihat pada klip-klip yang telah dikembalikan.



