AI视频提示符遵循度对比:6种模型在相同提示符下的测试结果

导演正在电影级显示器上审看六段符合AI视频提示要求的生成的视频

不同AI视频模型在遵循同一提示时的表现如何? 本次AI视频提示遵循度对比测试通过GLBGPT平台对六款模型进行了测试:Wan 3.0、Kling 3.0、Seedance 2.5、Grok Imagine、Happy Horse 1.0以及Veo 3.1。 每个模型都接收相同的提示,以便您观察哪个模型能更好地保留所要求的物体、摄像机运动、事件顺序和音频要求。.

每张主卡都使用一个固定的英文提示语和至少四个模型生成的结果。电影风格卡使用了全部六个模型;其他卡则从同一组六个模型中选取了四个模型。我们采用了16:9的画幅和720p的分辨率,随后检查了生成的视频和样片,以确认提示语是否在画面中清晰可见。.

快速回答: 这五个题目中并没有一个能通吃所有题目的答案。. Wan 3.0 在运动测试中呈现了最清晰的摄像机画面,, 克林 3.0 最忠实地保留了陶器的图案,并且 Seedance 2.5 将电影中的人物行走、转身以及电车抵达的场景按最清晰的顺序呈现出来。. Grok Imagine 在消费级相机领域表现强劲,, Happy Horse 1.0 让角色和情节转折读起来通顺,并且 Veo 3.1 针对“电影”、“动作”和“陶艺”这三个提示,系统返回了可用的文件,其中后两个提示返回的时长较短。.

什么是AI视频提示符遵循度?

“提示符符合度”是指生成的视频在多大程度上保留了您请求中的细节。我们检查了命名对象、颜色和图案、摄像机运动、事件顺序、角色连贯性,以及音频或对话限制。.

一段视频片段看起来可能非常精致,却仍可能偏离提示要求。它或许能呈现出逼真的雨景,却可能漏掉了电车;将一道细微的白色波纹变成了另一种图案;改变了演员的面部特征;或者在故事的高潮之前就戛然而止。因此,每张卡片都在模型生成的结果和观察到的偏差旁边,明确标注了提示的重点所在。.

本次对比中的六款机型

本文中,这六款机型均使用相同的访问标签: GLBGPT. 该表格列出了完整的产品阵容;其中没有单独的型号部分仅介绍两家供应商。.

模型访问本对比评测中的即时报道这些卡片测试的内容
Wan 3.0GLBGPT全部五个提示镜头运动、角色、动作、音效、故事顺序
克林 3.0GLBGPT全部五个提示镜头运动、角色、动作、音效、故事顺序
Seedance 2.5GLBGPT电影感、角色、对话事件顺序、角色细节、对话场景
Grok ImagineGLBGPT电影感、动作、对话镜头走位、动作覆盖、双人对话场景
Happy Horse 1.0GLBGPT电影、人物、陶艺角色连贯性与三段式故事结构
Veo 3.1GLBGPT电影相关请求、动态、陶艺路线确认、镜头运动、故事节点

我们如何测试这六款机型

我们在比较输出结果之前,将五个提示词固定了下来。模型在不同卡片之间有所变化,但每张卡片内的提示词、宽高比、分辨率、时长和音频设置均保持不变。一个具有代表性的 GLBGPT 请求格式如下:

{
  "surface": "GLBGPT",
  "model": "seedance-2.5",
  "prompt": "相同的测试提示词",
  "aspect_ratio": "16:9",
  "resolution": "720p",
  "duration": 5,
  "audio": false
}
提示同一张卡片中对比的机型已修复的设置
电影风格的文字转视频Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine · Happy Horse 1.0 · Veo 3.15秒 · 720p · 16:9 · 无音频
字符一致性Wan 3.0 · Kling 3.0 · Seedance 2.5 · Happy Horse 1.05秒 · 720p · 16:9 · 无音频
复杂的运动和摄像机控制Wan 3.0 · Kling 3.0 · Grok Imagine · Veo 3.15秒 · 720p · 16:9 · 无音频
对话和原声Wan 3.0 · Kling 3.0 · Seedance 2.5 · Grok Imagine5 秒 · 720p · 16:9 · 请求使用原声
三拍陶器故事Wan 3.0 · Kling 3.0 · Happy Horse 1.0 · Veo 3.115 秒 · 720p · 16:9 · 请求使用原声

六种模型的提示遵循性测试卡

测试已完成 以下五个提示词将每组比较整合在一起。每个提示词至少包含四个模型;第一个影视提示词包含全部六个模型。返回时长是根据每个本地 MP4 文件测算的,因此,提前结束的路线会被描述为“已返回”,而非被视为隐藏的质量评分。.

提示 1 · 六款机型 · 5s · 720p · 16:9

电影级文本转视频

提示: 一个电影式的跟拍镜头,跟随一位身穿长款红色大衣的女子,穿行在夜色中被雨水浸湿、霓虹灯闪烁的街道上。当一辆有轨电车从她身后驶过时,她转向镜头,车灯的倒影自然地在湿漉漉的路面上移动。人物动作真实自然,面部和衣着风格统一,采用浅景深,手持摄像机运镜稳定,全程无剪辑。.

Wan 3.0 GLBGPT

克林 3.0 GLBGPT

Seedance 2.5 GLBGPT

Grok Imagine GLBGPT

Happy Horse 1.0 GLBGPT

Veo 3.1 GLBGPT · 5.04秒

  • 万: 跟随那位女士,展示转身动作,并将电车带过背景。.
  • 克林 虽然保留了雨天那迷人的光线,但拍摄对象相对静止。.
  • Seedance 2.5: 保持“背影行走”、“可见转弯”和“电车抵达”按要求的顺序出现。.
  • Grok: 画面中保留了那件红外套、雨景、霓虹灯闪烁的街道以及有轨电车,其中有轨电车明显从人物身后驶过。.
  • 快乐马: 镜头从该女子身后开始,随后通过更近的特写镜头将转角处和电车纳入画面。.
  • Veo: 保留了红色外套和电车通行证,但镜头比“Wan”和“Seedance”版本的画面更静态。.

任务观察:Seedance 2.5 的事件顺序匹配最为清晰;在这张包含六款模型的卡片中,Wan 的镜头/动作覆盖范围最为全面。.

提示 2 · 四位模特 · 5 秒 · 720p · 16:9

在没有参考图片的情况下保持角色形象的一致性

提示: 一个长镜头,镜头中始终是同一位年迈的钟表匠:他戴着圆形的银框眼镜,穿着绿色马甲,左眉上方有一道小疤痕。他拿起一只怀表,从工作台走到窗边,侧身转过身,然后又面向镜头。整个过程中,他的面部、眼镜、衣着、年龄和疤痕均保持不变。.

Wan 3.0 GLBGPT

克林 3.0 GLBGPT

Seedance 2.5 GLBGPT

Happy Horse 1.0 GLBGPT

  • Wan 和 Kling: 既要让制表师的形象依然可辨,但两幅作品中都没有清晰地保留那道眉毛上的疤痕。.
  • Seedance 2.5: 保留了那位年迈的钟表匠、眼镜、马甲以及从工作台到窗户的动作;伤疤并不明显。.
  • 快乐马: 在从侧面到正面的动作中,眼镜和马甲依然保留着;那道标志性的疤痕也不太明显。.

任务观察:这四种方法在保留主体特征方面均优于保留最细微的面部细节;未选出模型层面的优胜者。.

提示 3 · 四位模特 · 5 秒 · 720p · 16:9

复杂运动与摄像机控制

提示: 一名骑车人飞驰而下,穿过拥挤的地中海集市;镜头以低角度正面跟拍开场,顺势向左侧平滑转动,最终升至高空,呈现出一个广角俯视画面。小贩们纷纷让路,布制遮阳篷随风摇曳,橙子从翻倒的篮子里滚落出来,每一个动作都按此顺序发生,且符合真实的物理规律。.

Wan 3.0 GLBGPT

克林 3.0 GLBGPT

Grok Imagine GLBGPT

Veo 3.1 GLBGPT

  • 万: 呈现出最清晰的前方追踪动作,并切换为俯视视角。.
  • 克林 更直观地展示了倾斜的篮子和滚动的橘子。.
  • Grok: 完成了一个流畅的“从正面到侧面再到头顶”的动作,并让橘子始终处于视野之中。.
  • Veo: 画面中保留了骑车人和集市,但后几帧中遮阳篷占据了主导地位;整个事件的顺序则不太明确。.

任务观察:Wan 和 Grok 的摄像头路径覆盖范围最广;Kling 在橙色细节的呈现上最为出色。.

提示 4 · 四位模特 · 5 秒 · 720p · 要求保留原声

对话与原声

提示: 在一节安静的火车车厢里,一位女士说:“我们错过了上一站。”对面的一位男士回答道:“那我们就一直坐到终点吧。”请确保两人的声音清晰可辨,将每句台词与对应的说话者同步,加入细微的火车环境音和车轮声,且不要添加背景音乐。.

Wan 3.0 GLBGPT

克林 3.0 GLBGPT

Seedance 2.5 GLBGPT

Grok Imagine GLBGPT

  • 这四段视频均显示了火车车厢内的场景,其中有两名可见的发言者。.
  • Wan 和 Kling 在保存的记录中返回了时长为 5.04 秒的立体声 AAC 音轨;已对新的 Seedance 和 Grok 文件进行了场景覆盖范围检查,但具体的语音内容及说话人分配仍需通过受控聆听环节来确认。.
  • Seedance 将女性和男性分别展示在不同的画面中;Grok 则在大部分画面中将两位发言者置于同一列火车的车厢内。.

任务观察:在将四段音频转录并按照相同的评审流程进行收听之前,不会确定获胜者。.

提示 5 · 四位模特 · 15 秒 · 720p · 要求保留原声

《三拍陶器》故事(配对版)

提示: 创作一个连贯的15秒电影式故事,包含三个相互关联的场景:在一个温馨的陶艺工作室里,一位身穿锈色围裙的成年工匠正在转轮上拉坯制作一个高大的蓝色花瓶; 同一位工匠在花瓶上精心绘制出纤细的白色波浪纹;完成后的花瓶矗立在木桌上,旁边摆放着一盆小绿植,工匠则在背景中微笑。全片需始终保持同一位成年工匠、锈色围裙、蓝色花瓶、陶艺工作室以及温暖的灯光。 采用自然的场景过渡、逼真的手部动作、柔和的陶轮和画笔声效,且不使用旁白或配乐。.

Wan 3.0 GLBGPT

克林 3.0 GLBGPT

Happy Horse 1.0 GLBGPT

Veo 3.1 GLBGPT

  • 万: 不仅完成了造型、上色和展示,还将要求的细波纹扩展成了更宽的装饰图案。.
  • 克林 更忠实地保留了那道醒目的白色波浪和锈色的围裙。.
  • 快乐马: 保留了蓝色花瓶、白色波浪和最后的植物陈列;手工制作的边框会在不同节奏之间变换。.
  • Veo: 通过可见的波浪和植物,完成了花瓶的工作流程及最终展示;身份连续性比物体连续性更不稳定。.

任务观察:Kling 在白波的细节表现上最为突出;Happy Horse 和 Veo 清晰地呈现了三个故事节点。.

您应该选择哪款机型?

选择 Wan 3.0 的理由:

  • 大胆的镜头运动
  • 更详尽的报道
  • 适用于动作密集型提示词的绝佳起点

选择 Kling 3.0 的适用场景:

  • 直观的视觉细节与图案
  • 角色对话与口型同步工作流程
  • 紧凑型多镜头场景

选择 Seedance 2.5 用于:

  • 有序的电影事件
  • 在一段简短的描述中既展现了明显的转折,又包含背景情节
  • 事件顺序比总体分数更重要的提示

在以下情况下,请尝试使用 Grok、Happy Horse 或 Veo:

  • 你想要第二种摄像机视角的演绎
  • 你注重故事节点和人物刻画的连贯性
  • 您可以在正式上线前测试具体的提示语

本次对比中,所有六款模型均通过 GLBGPT 调用。您可以在同一工作区中运行自己的提示词,比较生成的卡片,并选择能保留您项目实际所需细节的方案。.

最终提示——合规性裁决

没有通用的获胜模式。. 这项针对六种模型的测试得出了各任务层面的优胜者:Wan 3.0 在摄像机覆盖范围方面表现最佳,Kling 3.0 在陶器图案还原方面表现最佳,而 Seedance 2.5 在电影化简报中的事件顺序方面表现最佳。Grok Imagine 很好地处理了市场场景中的摄像机走位, Happy Horse 1.0 确保了角色与陶器场景的连贯性,而 Veo 3.1 在不同提示下的执行效果则参差不齐。这些发现仅描述了本次测试中的特定提示和运行结果,并不代表所有可能的视频任务场景。.

常见问题

你测试了哪六款AI视频模型?

我们通过 GLBGPT 对 Wan 3.0、Kling 3.0、Seedance 2.5、Grok Imagine、Happy Horse 1.0 以及 Veo 3.1 进行了测试。.

每个提示词都使用了多个模型吗?

是的。每张主要提示卡至少包含四个模型,而电影风格卡则包含全部六个模型。这样可以确保每个提示都作为比较单位,而不是为单个模型单独设置提示。.

哪种模型最符合电影事件的顺序?

在本次拍摄中,Seedance 2.5 最清晰地按要求呈现了“红衣人行走”、“转向镜头”以及“电车抵达”的动作顺序。Wan 3.0 在配对的电影化镜头中展现了更全面的镜头覆盖和动作呈现。.

哪款机型在视觉细节的呈现上表现最佳?

Kling 3.0 最为直观地再现了陶器故事中那道纤细的白色波纹。由于这是任务层面的观察结果,因此徽标、服装或线稿类提示词仍应进行直接测试。.

Veo 3.1 在该矩阵中的表现如何?

Veo 3.1 生成了可用的影视文件,并完成了可见动作和陶艺片段,但尽管要求时长更长,动作文件仅约4秒,陶艺文件也仅约8秒。这些较短的输出结果被记录为执行细节,并未转换为通用质量评分。.

这些视频可以用于商业用途吗?

商业使用权取决于当前的套餐及访问路径所附带的条款。在发布付费客户作品或广告素材之前,请仔细查阅最新条款。.

来源与测试证据

  • 希格斯菲尔德依从性比较 — 关于“同一提示语对比”这一想法的参考。.
  • GLBGPT 任务记录和本地 MP4 输出——五张提示矩阵,720p,16:9,每张卡片上均显示相应设置。.
  • 本地联系表——用于检查返回的片段中事件的顺序、物体的连续性、摄像机的运动以及可见细节。.
分享帖子:

相关帖子