不同的人工智慧影片模型在遵循同一提示時表現如何? 這項 AI 影片提示遵循度比較測試透過 GLBGPT 平台,針對六種模型進行評估:Wan 3.0、Kling 3.0、Seedance 2.5、Grok Imagine、Happy Horse 1.0 以及 Veo 3.1。 每個模型都會收到相同的提示,讓您能觀察哪個模型能最佳地保留所要求的物件、鏡頭運動、事件順序以及音訊需求。.
每張主卡均採用一個固定的英文提示語,並產生至少四個模型輸出結果。電影風格卡使用全部六個模型;其餘卡片則從同一組六個模型中選取四個模型。我們採用 16:9 畫面比例與 720p 輸出解析度,隨後檢視生成的影片及 contact sheets,以確認提示語是否在畫面中清晰呈現。.
快速回答: 這五道題目中,並沒有哪一道能成為通用的贏家。. Wan 3.0 在動態測試中呈現出最清晰的鏡頭畫面,, Kling 3.0 最忠實地保留了陶器的圖案,並且 Seedance 2.5 將電影中的行走、轉身以及電車抵達的場景,以最清晰的順序呈現出來。. Grok Imagine 在市售相機領域表現強勁,, Happy Horse 1.0 讓角色塑造與情節節奏讀來流暢,而且 Veo 3.1 針對「電影」、「動態」和「陶藝」這三個提示,系統回傳了可用的檔案,其中後兩者的回傳時長較短。.

何謂 AI 影片提示遵循度?
「提示準確度」是指生成的影片在多大程度上保留了您請求中的細節。我們檢查了命名物件、色彩與圖案、鏡頭移動、事件順序、角色連貫性,以及音訊或對白限制。.
一段影片即使看起來精緻流暢,仍可能偏離提示。它或許能呈現逼真的雨景,卻可能遺漏了電車;將一道細微的白浪變成了不同的圖案;改變了演員的臉部特徵;或是未能在故事的高潮時刻前戛然而止。因此,每張卡片都會在模型輸出結果與觀察到的偏差旁,明確標示提示的核心重點。.
本次比較中的六款機型
本文中,這六款機型均使用相同的存取標籤: GLBGPT. 該表格列出了完整的產品陣容;其中並未設有僅介紹兩家供應商的獨立型號專區。.
| 模型 | 存取 | 本比較中的即時報導 | 這些卡片測試的內容 |
|---|---|---|---|
| Wan 3.0 | GLBGPT | 全部五個提示 | 鏡頭運動、角色、動作、音效、故事順序 |
| Kling 3.0 | GLBGPT | 全部五個提示 | 鏡頭運動、角色、動作、音效、故事順序 |
| Seedance 2.5 | GLBGPT | 電影感、角色、對白 | 事件順序、角色細節、對話場景 |
| Grok Imagine | GLBGPT | 電影感、動態、對白 | 鏡頭走位、動作涵蓋範圍、雙主角場景 |
| Happy Horse 1.0 | GLBGPT | 電影風格、角色、陶藝 | 角色一貫性與三段式故事結構 |
| Veo 3.1 | GLBGPT | 電影相關請求、動態、陶藝 | 路線確認、鏡頭運動、故事節點 |
我們如何測試這六款機型
我們先將五個提示語固定下來,然後再比較產出結果。模型在每張卡片中各不相同,但每張卡片內的提示語、長寬比、解析度、時長及音訊設定均保持一致。一個具有代表性的 GLBGPT 請求格式如下:
{
"surface": "GLBGPT",
"model": "seedance-2.5",
"prompt": "相同的測試提示詞",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": 5,
"audio": false
}
| 提示 | 在同一張卡片中比較不同機型 | 已設定的設定 |
|---|---|---|
| 電影風格的文字轉影片 | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine · Happy Horse 1.0 · Veo 3.1 | 5 秒 · 720p · 16:9 · 無音訊 |
| 字元一致性 | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Happy Horse 1.0 | 5 秒 · 720p · 16:9 · 無音訊 |
| 複雜的運動與攝影機控制 | Wan 3.0 · Kling 3.0 · Grok Imagine · Veo 3.1 | 5 秒 · 720p · 16:9 · 無音訊 |
| 對白與原聲配音 | Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine | 5 秒 · 720p · 16:9 · 要求使用原始音訊 |
| 三拍陶器故事 | Wan 3.0 · Kling 3.0 · Happy Horse 1.0 · Veo 3.1 | 15 秒 · 720p · 16:9 · 請使用原始音訊 |
六款模型提示遵循度測試卡
測試已完成 以下五個提示詞將每組比較歸為一類。每個提示詞至少有四個模型;第一個電影類提示詞則包含全部六個模型。返回時間是根據每個本地的 MP4 檔案來計算的,因此若某條路徑提前結束,則被描述為「已返回」,而非被視為隱藏的品質分數。.
提示 1 · 六款機型 · 5 秒 · 720p · 16:9
電影級文字轉影片
提示: 一個電影式的跟拍鏡頭,跟隨一位身穿長款紅大衣的女子,穿行於夜晚被雨水浸透的霓虹燈街道上。當一輛電車從她身後駛過時,她轉身面向鏡頭,車身倒影自然地在濕漉漉的路面上流動。人物動作逼真,臉部與服裝細節連貫,淺景深,手持攝影機控制得當,全程無剪接。.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2.5 GLBGPT
Grok Imagine GLBGPT
Happy Horse 1.0 GLBGPT
Veo 3.1 GLBGPT · 5.04 秒
- 萬: 跟隨那位女子,展現轉身動作,並將電車帶過背景。.
- Kling: 雖然保留了雨天那迷人的光線,但主體相對靜態。.
- Seedance 2.5: 會將「背影行走」、「可見轉身」和「電車抵達」依要求順序呈現。.
- Grok: 畫面保留了那件紅外套、雨景、霓虹燈閃爍的街道以及電車,其中電車明顯從主體身後駛過。.
- 快樂馬: 鏡頭從該名女子身後開始,接著透過更緊密的特寫鏡頭,將轉身與踏步的畫面納入畫面中。.
- Veo: 雖然保留了紅色外套和電車通行證,但相較於「Wan」和「Seedance」的輸出,這段影片的鏡頭更為靜態。.
任務觀察:Seedance 2.5 的事件順序匹配最為清晰;在這張包含六款機型的卡片中,Wan 的鏡頭與動作覆蓋範圍最為全面。.
提示 2 · 四位模特 · 5 秒 · 720p · 16:9
在沒有參考圖片的情況下保持角色形象的一致性
提示: 一個連續鏡頭,拍攝同一位年邁的鐘錶師:他戴著圓形銀框眼鏡,身穿綠色馬甲,左眉上方有一道小疤痕。他拿起一只懷錶,從工作檯走向窗邊,轉身側對鏡頭,隨後又轉回面對鏡頭。整個鏡頭中,他的臉部、眼鏡、衣著、年齡及疤痕均保持不變。.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2.5 GLBGPT
Happy Horse 1.0 GLBGPT
- Wan 與 Kling: 讓這位鐘錶師的樣貌依然可辨,但兩者都未能清晰地保留那道眉毛上的疤痕。.
- Seedance 2.5: 保存了這位年邁鐘錶師的眼鏡、背心,以及從工作檯延伸至窗邊的動作;那道疤痕並不明顯。.
- 快樂馬: 在從側面轉向正面的動作中,眼鏡和馬甲仍保持原樣;那道標誌性的疤痕也不太明顯。.
任務觀察:這四種方法在保留主要特徵方面,表現均優於保留最細微的面部細節;未選出模型層級的優勝者。.
提示 3 · 四位模特 · 5 秒 · 720p · 16:9
複雜的運動與攝影機控制
提示: 一名自行車手疾馳而下,穿梭於人潮擁擠的地中海市集之中;鏡頭起初以低角度正面跟拍開場,隨後順暢地向左側弧形移動,最終升至高空,呈現廣角俯瞰視角。攤販們紛紛讓路,布製遮陽篷隨風飄動,橘子從傾倒的籃子裡滾落,而每個場景都依循此順序發生,並展現出逼真的物理效果。.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Grok Imagine GLBGPT
Veo 3.1 GLBGPT
- 萬: 呈現出最清晰的前方追蹤動作,並切換為俯視視角。.
- Kling: 更清楚地展現了傾斜的籃子與滾動的橘子。.
- Grok: 完成了一個流暢的「從前方→側面→頭頂」動作,並讓橘子始終保持在視野中。.
- Veo: 畫面中保留了騎單車的人和市場,但讓遮陽篷在後面的幾個畫面中佔據主導地位;整個事件的時序較為模糊。.
任務觀察:Wan 和 Grok 的鏡頭路徑覆蓋範圍最廣;Kling 在捕捉橘色細節方面表現最為出色。.
提示 4 · 四位模特 · 5 秒 · 720p · 要求保留原始音訊
對白與原聲配音
提示: 在安靜的火車車廂內,一名女子說:「我們錯過上一個站了。」對面的一名男子回答:「那我們就坐到終點站吧。」請確保兩人的聲音清晰可辨,將每句台詞與對應的說話者同步,加入細微的火車環境音與車輪聲,且不要添加音樂。.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Seedance 2.5 GLBGPT
Grok Imagine GLBGPT
- 這四段回放的火車車廂場景中,均有兩名可見的發言者。.
- Wan 和 Kling 在儲存的記錄中回傳了 5.04 秒的立體聲 AAC 音軌;針對新的 Seedance 和 Grok 檔案,已檢視其場景涵蓋範圍,但確切的語音內容與發言者分配仍需進行受控聆聽測試。.
- Seedance 分別呈現女性與男性的畫面;Grok 則在大多數畫面中,將兩位發言者置於同一列火車車廂內。.
任務觀察:在將四段音訊轉錄並依照相同的審查規範進行聆聽之前,不會指定勝出者。.
提示 5 · 四位模特 · 15 秒 · 720p · 要求保留原聲
《三拍陶器故事》全套
提示: 創作一個由三個相互關聯的場景組成的、連貫的15秒電影式故事:在溫暖的陶藝工作室裡,一位身穿鏽色圍裙的成年工匠正坐在轉輪前,將藍色的高腳花瓶塑形; 同一位工匠仔細地在花瓶上繪製出細緻的白色波浪紋樣;完成的花瓶置於木桌上,旁邊擺放著一盆小型綠植,而工匠則在背景中微笑。全片須貫穿使用同一位成年工匠、鏽色圍裙、藍色花瓶、陶藝工作室及溫暖的燈光。 請採用自然的場景轉場、逼真的手部動作、柔和的陶輪與畫筆聲響,且不使用旁白或配樂。.
Wan 3.0 GLBGPT
Kling 3.0 GLBGPT
Happy Horse 1.0 GLBGPT
Veo 3.1 GLBGPT
- 萬: 除了完成塑形、上色與展示外,還將所要求的細波紋擴展成更寬闊的裝飾圖案。.
- Kling: 更直白地保留了那道醒目的白色波浪線,以及那塊鏽紅色的前裙板。.
- 快樂馬: 保留了藍色花瓶、白色波浪以及最後的植物擺設;工藝風格的邊框會在不同節拍間變換。.
- Veo: 透過可見的波浪與植物,完成花瓶的工作流程與最終陳列;其「身份連續性」較「物件連續性」更為不穩定。.
任務觀察:Kling 在「白色波浪」的細節呈現上最為出色;Happy Horse 和 Veo 則清晰地涵蓋了這三個故事節點。.
您應該選擇哪一款機型?
選擇 Wan 3.0 的理由:
- 大膽的鏡頭運鏡
- 更詳盡的報導
- 針對動作密集型提示詞的絕佳起點
選擇 Kling 3.0 的適用場合:
- 直白的視覺細節與圖案
- 角色對白與嘴型同步的工作流程
- 緊湊的多鏡頭場景
選擇 Seedance 2.5 適用於:
- 有序的電影事件
- 在一段簡短的敘述中,既展現了明顯的轉折,又包含背景情節
- 在這些提示中,事件順序比整體分數更為重要
在以下情況下,請嘗試使用 Grok、Happy Horse 或 Veo:
- 您希望獲得第二種鏡頭的詮釋
- 你重視故事節奏的流暢性與事件的全面性
- 您可以在正式上線前測試確切的提示語
本次比較中,所有六種模型皆透過 GLBGPT 進行存取。請在同一工作區中執行您自己的提示語,比較返回的卡片,並選擇能保留您專案實際所需細節的路線。.
最終提示遵循度評斷
沒有一個通用的獲勝模式。. 這項包含六種模型的測試得出了各任務層級的優勝者:在鏡頭覆蓋範圍方面,Wan 3.0 勝出;在陶器圖案的字面還原方面,Kling 3.0 勝出;而在電影式簡報中的事件順序方面,Seedance 2.5 勝出。Grok Imagine 很好地處理了市場場景的鏡頭路徑, Happy Horse 1.0 成功保持了角色與陶器節奏的清晰可辨,而 Veo 3.1 在各提示詞下的執行結果則參差不齊。這些發現僅描述了這些特定提示詞與執行結果,並不代表所有可能的影片簡報皆然。.
常見問題
您測試了哪六種 AI 影片模型?
我們透過 GLBGPT 測試了 Wan 3.0、Kling 3.0、Seedance 2.5、Grok Imagine、Happy Horse 1.0 以及 Veo 3.1。.
每個提示字串是否都使用了多個模型?
是的。每張主要提示卡至少包含四款車型,而電影風格卡則包含全部六款。這樣一來,每條提示便能作為比較單位,而非為單一車型另設獨立提示。.
哪個模型最貼近電影事件的發生順序?
在本次拍攝中,Seedance 2.5 最清晰地呈現了「紅衣人行走」、「轉身面向鏡頭」以及「電車抵達」這三個動作,且完全按照要求的順序進行。Wan 3.0 在成對的電影級影片中,展現了更全面的鏡頭與動作涵蓋範圍。.
哪一款模型最能保留細膩的視覺細節?
Kling 3.0 最直白地呈現了陶器故事中那道細膩的白色波紋。由於這是任務層級的觀察結果,因此標誌、服裝或線稿提示仍應直接進行測試。.
Veo 3.1 在此矩陣中的表現如何?
Veo 3.1 產出了可用的電影級檔案,並完成了「可見動作」與「陶藝」兩個環節,但儘管要求的是更長的時長,動作檔案僅約四秒,陶藝檔案則約八秒。這些較短的產出結果已記錄為執行細節,並未轉換為通用品質評分。.
這些影片可以拿來做商業用途嗎?
商業使用權取決於當前方案及存取路徑所附帶的條款。在發布付費客戶作品或廣告素材之前,請先檢視最新條款。.
資料來源與測試證據
- 希格斯菲爾德依從性比較 — 關於「同一提示比較」構想的參考資料。.
- GLBGPT 任務紀錄與本機 MP4 輸出檔 — 五組提示矩陣、720p、16:9,各張卡片上均顯示相關設定。.
- 局部對照表——用於檢查已提交片段中的事件順序、物體連續性、攝影機移動以及可見細節。.



