为什么AI视频会把手和脸识别错误

AI生成的视频中,手部和面部会出现问题,因为模型必须确保解剖结构、身份特征、光照、姿势和动作在多个帧之间保持一致,而不仅仅是绘制出一帧逼真的图像。. 一只在第20帧看起来还算正常的手,可能在第24帧横跨脸部,在第26帧改变手指间距,并在第28帧与头发融合。此时,模型必须同时修复多个不确定区域。.

我们通过 GlobalGPT CLI,将一条简短的“友好波”提示与一条限制条件多得多的“张开手掌”提示进行了对比测试。 受限版本生成的动作更为平稳,手部姿势也更易于识别。但它未能保留源人物的身份、服装、麦克风或房间环境。这种混合结果比完美的演示更有价值,因为它展示了提示约束能够控制和无法控制的内容。.

2段短视频
姿势的可读性得到提升
未保留标识符
立即体验热门视频模特

为何手部结构会随时间演变而失效

手是一种具有众多细微部件、频繁发生自遮挡且轮廓变化迅速的关节化物体。挥手时,手部会旋转,手指相互重叠,运动模糊会使边缘变得模糊,且手掌会相对于面部发生位移。生成器必须从每个新视角推断出一致的3D结构,同时保持上一帧的特征。.

这些问题会表现为多余的手指、并指、指甲位置异常、手腕像橡胶一样松软,或者手会“换边”。更广泛地来说, 基于AI的视频故障诊断 有助于将解剖学上的错误与摄像、物理和连续性上的错误区分开来。.

为什么即使单帧画面看起来不错,人物面部也会出现漂移现象

面部对眼距、眼睑形状、嘴角、鼻宽和发际线的细微变化非常敏感。说话和表情会使这些特征点不断移动。如果面部变小、转开、被阴影遮挡或被手部分遮挡,模型可参考的特征就减少了,可能会重新识别身份。.

这就是为什么 AI视频一致性工作流 将角色稳定性视为一个序列问题。强有力的第一帧固然有帮助,但提示、镜头、时长和动作也必须共同维护角色身份特征。.

我们的基准测试和受限测试

两次实验均使用了同一张源图像,并采用Grok Imagine路线,分辨率设为1280×720,持续时间约为五秒。 基线任务要求该女子面向摄像头并挥手。受限提示中指明了右手,要求五指张开,将手置于肩旁,禁止遮挡面部,限制头部移动,并锁定摄像头。.

每项任务的费用为500积分。这是一项A/B观察实验,每个提示仅进行一次测试,并非统计学意义上的受控实验。我们从固定时间段中抽取样本,并以正常速度查看了视频。.

一次基线运行。生成的波形充满活力,但生成的角色和房间与源图像存在显著差异。.
一次受限运行。动作更平稳,手势也更清晰易辨,但身份保留仍未成功。.
通过采样帧比较基线波形与受限的张掌手势
两次单次观测。虽然观测结果限制了瞬时运动和成分的变化,但这组数据无法确立普遍的因果关系。.

基线结果:动态明显,身份漂移显著

基线生成了一段亲切而充满活力的挥手动作。在采样帧中,张开的手掌依然清晰可辨,但生成的画面将源主机替换成了一位外貌不同的女性——她身处另一间房间,穿着不同的服装。甚至在挥手动作成为主要动作之前,画面构图就已经发生了变化。.

这一结果表明,仅凭视觉上吸引人的界面是不够的。如果该职位需要经常出镜的主持人,那么个人形象和环境就是难以逾越的接受标准。该 根据一张照片塑造一个形象统一的角色 本文探讨了可改善初始参考图的源图像选择方案,但我们的研究结果表明,仅靠单一源图像并不能保证连续性。.

受限结果:姿态更佳,但身份仍丢失

受限的动作幅度较小,手始终放在头部一侧,并保持更利落的掌心朝外姿势。手没有在脸上划过。这些差异使得该动作更容易观察,也能简化后期剪辑工作。.

然而,人物、服装、麦克风和房间的外观仍发生了显著变化。提示要求精确保留这些细节,但模型并未做到这一点。可以说,在本次测试中,受约束的运行提升了动作的可读性。但我们不能说它普遍修正了解剖结构, nor 保留了人物特征。.

围绕“可见性”和“运动”展开的写作提示

一个有用的手势提示应明确指出一个肢体、一个动作、一个姿势和一个持续时间。“举起右手,将张开的手掌放在肩膀旁,保持一秒钟,然后放下”这样的提示是可以测试的。而“一边兴奋地说话一边自然地做手势”则未明确说明涉及哪些关节、动作速度以及遮挡情况。.

摄像机运镜也很重要。固定摄像机,确保整只手都留在画面内,并在做手势时避免剧烈的变焦。该 摄像头和动作提示控制 为摄像机和运动控制提供了更丰富的术语,而 Veo 动作提示技术 增加了针对 Veo 的特定提示技术。.

在提升性能之前,先保护好面部

确保面部特写足够大,以便观众看清。在需要清晰辨识人物身份的关键时刻,尽量减少头部转动、夸张的表情以及双手交叉的动作。在将对话、道具和移动镜头结合使用之前,先要求演员进行轻微的眨眼和微小的嘴部动作。只有在最简单的镜头效果通过后,才增加画面复杂度。.

对于较长的片段,应将其拆分为起始帧和结束帧均保持稳定的镜头。该 长视频中角色的连贯性 解释了为什么随着片段的积累,角色连贯性会变得越来越难保持,以及锚点如何在剪辑过程中起到帮助作用。.

构建更优质的源帧

请使用一张清晰锐利、光线均匀的图片,确保双眼均可见,发际线轮廓清晰,且双手要么完全可见,要么完全位于裁剪范围之外。请避免手指被画面边缘裁切、过度的美颜滤镜、明显的运动模糊,以及与身体重叠的带图案背景。.

源帧还应与预期的视频构图相匹配。如果将一张特写人像强行改造成半身波浪构图,就会迫使模特同时“凭空”构思出双臂、双手、衣物以及场景细节。请在制作动画之前,先生成或拍摄所需的构图。.

筛选问题,而非重写所有内容

  • 如果手指缠在一起,请放慢动作,并将手从脸部或身体上移开。.
  • 如果角色形象出现偏差,请减少头部旋转幅度、表情变化范围以及片段时长。.
  • 如果手腕弯曲得有些奇怪,请简化手部运动轨迹,并取消与支撑物的交互。.
  • 如果背景发生变化,请锁定摄像头并描述固定的场景锚点。.
  • 如果同时出现多个故障,请切换回更干净的源帧。.

AI视频制作中的常见错误 列举了常导致这些连锁失败的常见规划失误。.

可复制的基线和受限提示词

先运行短基线,以便观察模型在没有辅助的情况下会做出何种选择。然后仅修改运动约束条件。保持模型、源素材、时长和宽高比不变。这样虽然两个单独的样本无法证明因果关系,但能使比较结果更易于解读。.

基线动作提示
受限的手脸提示词

逐帧回放,然后以正常速度播放

以正常速度播放可判断动作是否具有人性化。逐帧查看可发现解剖结构或人物特征何时开始出现偏差。检查动作的起始点、动作高峰、遮挡点和回归姿势。观察双手,而不仅仅是挥手的那只,并将眼睛形状和嘴角与源素材进行对比。.

记录下最早出现问题的帧。这能帮你判断是该更换素材、缩短镜头时长,还是对某个转场效果进行限制。如果只是笼统地指出“看起来怪怪的”,很难据此提出更具体的指导建议。.

将阻塞视为生产风险

当一个物体遮挡另一个物体时,就会发生遮挡现象:例如手指遮住脸部、头发遮住眼睛、道具遮挡手腕,或者身体背对摄像头。被遮挡的结构仍需被推断出来,而模型可能会以不同的形状将其还原。快速运动会使这种推断变得更加困难,因为相邻帧提供的证据不够稳定。.

安排动作时,要确保关键解剖结构始终清晰可见。将手放在脸部旁边,而不是脸部正前方。道具应远离手指关节。如果必须发生接触,可将动作分解为“接近”、“接触”和“松开”三个镜头,然后将它们剪辑在一起。这样可以减少单帧需要处理的生硬转场次数。.

在得出模型结论之前,请重复进行测试

这两个片段提供了有用的观察结果,但一个种子值可能会让提示效果大好,也可能让提示效果大坏。在实际选择模型时,请使用相同的源素材和设置,将每个提示重复多次。分别对文字可读性、人物身份、背景、摄像机角度和动作完成度进行评分。将被淘汰的输出结果记录在日志中。.

通过重复测试,可以判断受限提示是否提高了生成可用姿势的概率,还是仅仅生成了一个幸运的样本。这还可以揭示其中的权衡关系:更强的动作控制可能会削弱表情表现,或导致表演显得僵硬。应选择与镜头相匹配的平衡点,而不是一味追求单帧的完美。.

掌握何时编辑、何时重新生成

当角色特征、动作和镜头表现力都很强时,可以针对短暂的瑕疵进行剪辑处理。一个简短的切景可以掩盖两帧内的手指塌陷;更紧凑的剪辑可以去除不理想的回位姿势。当整个过程中面部发生变化、错误的手执行了动作、背景发生变化,或者多帧中解剖结构出现问题时,应重新生成角色模型。.

不要花一个小时去修复一个违反核心要求片段。反之,也不要因为一个可以通过常规剪辑掩盖的微小问题而放弃一段精彩的表演。在评审开始之前,验收清单应区分致命缺陷与可修正的瑕疵。.

使用人体动作验收清单

对于每个镜头,需分别从五个方面进行评分:角色特征、解剖结构、动作、镜头和场景。角色特征包括面部比例、发型和服装。解剖结构包括手指、手腕、肘部、牙齿和眼球运动。动作方面需检查要求的动作是否正确地开始、达到高潮并结束。镜头方面包括构图和不必要的晃动。场景方面包括道具、背景和灯光的一致性。.

请对每个片段标注“通过”、“可修复”或“废弃”。“可修复”的结果可能包含一个短暂的瑕疵帧,该帧可通过剪辑去除而不影响内容含义。“废弃”则指存在持续的身份偏移、反复的手部动作重叠或动作缺失。这种分类机制可防止存在致命连续性错误的片段,因视觉效果良好而被误认为合格。.

即使文章的重点是面部和手部特写,也应单独检查音频。意外的音频、语音失真或音轨缺失,都可能导致一个视觉上尚可的镜头无法使用。最终采用的素材是符合全部交付规范的文件,而不是在接触片中看起来最棒的静帧。.

实际结论

我们的受限提示生成的手势比基线模型更平稳、更易于识别,但两种输出在身份特征上都发生了显著变化。提示工程虽然改善了其中一个维度,却未能解决连续性问题。.

一种适用于正式拍摄的方法包括:构图得当的取景、一个受控的动作、稳定的摄像机、多次拍摄样片以及一份书面验收清单。当拍摄对象需要说话或操作道具时,应先在单独的短镜头中验证这些动作,然后再将它们结合起来。只有通过成功的测试,才能逐步增加拍摄的复杂度。.

不要仅凭最后一个画面来评判手部动作。要观察整个动作的起始到结束的完整过程,然后将面部表情与参考动作进行对比。即使手掌动作干净利落,也无法弥补动作者身份不符的问题;同样,即使面部表情保持稳定,也无法弥补动作过程中手腕塌陷的问题。.

比较 GlobalGPT 中的视频路由 当生成结果不理想时,请每次只更改一个变量,并保留原始数据、设置和被拒绝的原因。更逼真的手部和面部效果,源于在整个生成过程中降低不确定性,而非在已经信息过载的提示词中添加“完美的解剖结构”。.

在接下来的测试中,使用相同的源素材,分别针对身份、解剖结构、动作、摄像机和场景,重复多次这两个提示,并分别打分。这个小样本将显示,受限提示是否提高了保留率,还是仅仅产生了一个幸运的结果。 在核心动作稳定之前,保持动作简短且清晰可见。随后逐一添加台词、道具或摄像机运动,并保留每个通过审核阶段的干净版本。.

常见问题

为什么AI视频中的手会有多余的手指?

快速的关节运动、自遮挡、运动模糊以及视角变化,导致不同帧之间手指的结构难以确定。随着手的移动,模型可能会以不同的方式重绘手部。.

为什么在AI视频中脸部会发生变化?

小脸、头部转动、表情、阴影和遮挡都会削弱身份识别线索。随后,生成器会重建面部特征点,而不是精确保留它们。.

更好的提示词能解决AI的“手”的问题吗?

受限提示可以减少运动和遮挡,这在我们的单次测试中提高了可读性。但它无法保证在每个模型或每次运行中都能呈现正确的解剖结构。.

参考图像能否保证身份的一致性?

不。虽然强光源有帮助,但在运动过程中,视频模型仍可能改变人物、服装、房间或镜头构图。.

对于拍摄面部和手部,哪种摄像机运动方式最安全?

采用固定机位并采用中景或半身构图是最稳妥的起拍方式。只有在完成这个简单的动作之后,才应加入摇摄、变焦或环绕拍摄。.

如果某个镜头总是拍不好,我可以换个机型吗?

是的。GlobalGPT 允许您比较可用的视频路径。保持源数据和验收标准不变,以便您判断模型变更是否确实有所帮助。.

分享帖子:

相关帖子