MiniMax H3之所以引人注目,是因为它试图解决一个比基础的“文本转视频”更棘手的问题:当创意简报中包含主题图片、动作参考、摄像风格、音频提示或固定结尾画面时,如何确保创意简报的一致性。 关键问题并不只是 H3 能否制作出精美的视频片段,而是这些控制功能能否让最终结果更加可预测且实用。.
本篇关于 MiniMax H3 的评测详细剖析了其已核实的规格参数、官方示例、API 定价、生产限制,以及您在掏钱之前需要关注的关键未解问题。MiniMax 已公布了足够详细的信息,足以判断该产品的整体情况,但尚缺乏足够的独立证据来对其可靠性、速度或优越性做出广泛断言。.

什么是 MiniMax H3?
MiniMax H3 是 MiniMax 推出的一款开放式通用多模态视频模型。根据 官方视频制作指南, ,它能够在一条请求中处理文本、图像、视频和音频输入,并支持视频生成、基于参考的创作以及视频编辑。该公开 API 的模型名称为 MiniMax-H3.
实际上的区别在于控制权。一个简单的视频生成器仅根据提示生成内容,其余部分则由系统自动生成。而H3还可以使用起始帧、结束帧、参考图片、参考视频片段或参考音频。这为创作者提供了更多方式来定义出现的人物、摄像机的运动方式、应遵循的风格以及镜头结束的位置。.
MiniMax H3 规格一览
| 规格 | MiniMax H3 |
|---|---|
| 官方型号名称 | MiniMax-H3 |
| 输入类型 | 文本、图片、视频和音频 |
| 输出分辨率 | 2K |
| 输出时长 | 4–15 秒,整数值 |
| 发电模式 | 文本转视频、首帧/末帧图像转视频、参考生成 |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16,或在支持的情况下采用自适应模式 |
| 提示词限制 | 最多 7,000 个字符 |
| 参考范围 | 最多 9 张图片、3 个视频片段和 3 个音频片段;共计 12 个混合文件 |


参考容量
一个提示词可以协调四种输入类型
混合媒体文件数量上限为12个。音频文件需至少配有一张参考图片或一段参考视频。.
这些规格来自 MiniMax 的 V2 视频 API 参考文档. 文本转视频需要固定的宽高比。首帧或末帧的生成遵循图像的宽高比,而参考帧的生成则可以使用自适应或指定的宽高比。.
2K 标签是一种输出规格,并不保证每一帧的细节程度都相同。分辨率、时间一致性、提示准确性和物理真实感都是独立的质量问题。这些问题需要通过受控测试来验证,而非仅凭规格表上的结论。.
MiniMax H3 的特点与突出优势
以下官方视频是 MiniMax 精选的示例。这些视频有助于了解各项功能的预期工作原理,但精选示例与独立压力测试并不相同。.
带摄像机运动方向的文字转视频
H3 仅凭文字描述就能生成视频。MiniMax 还建议加入摄像机方向等信息,例如 [pan], [放大], 或 [静态] 紧接在相关描述之后。这使得提示词既要负责场景内容,又要负责镜头行为。.
在这个官方示例中,值得关注的不仅仅是表面细节。请观察摄像机是否遵循了描述中的运动轨迹,主体在各帧之间是否保持连贯,以及当动作变得更加复杂时,画面构图是否依然协调统一。.
统一的多模态参考文献
参考素材生成是H3与普通仅支持提示词的工具截然不同的最明显原因。一次请求即可将文字指令与参考图片、参考视频和参考音频相结合。MiniMax表示,该模型可以利用这些素材来遵循特定主题、动作、摄像风格、视觉风格、声音或剪辑节奏。.
这种方法适用于以角色为主导的广告、产品特写、品牌宣传片以及动作转换,因为创作者可以提供“一致性”应如何理解的依据。其取舍在于设置要求更高:参考素材的质量、角色标签、文件大小限制以及提示语的清晰度都会影响请求结果。.
如果视频到视频是您项目的核心,那么更广泛的 AI 视频到视频工作流 解释了为什么动作和结构提示与文本提示同样重要。.
首帧和末帧控制
H3 支持指定起始帧、结束帧或两者兼有。这使创作者能够定义镜头从何处开始以及必须到达何处,而模型则负责生成这两个点之间的过渡效果。.
对于此类示例,请判断过渡效果是否显得有意为之,以及两个端点图像是否仍可辨认。此控制功能适用于“前后对比”序列、产品展示、角色变身,以及由两个已通过审核的关键帧组成的短片段。.
在这本指南中也出现了一个类似的制作构想,内容涉及 用两张照片制作一部短片, ,尽管模型和具体的控制方式有所不同。.
2K输出,时长可在4至15秒之间灵活调整
MiniMax H3 支持 2K 输出,以及 4 至 15 秒的整数时长。这一时间范围足以容纳完整的社交场景、产品特写、转场或简短的电影化镜头序列,而无需将每个创意都硬塞进固定的 6 秒或 10 秒模板中。.
以生产为导向的投入限制
该模型支持最长7,000个字符的提示词。参考素材生成最多支持9张图片、3段视频和3个音频文件,混合文件总数上限为12个。单个参考视频和音频片段的时长可在2至15秒之间,而所有参考视频的总时长上限为15秒。.
这些限制表明应采用结构化的制作方式,但投入越多并不一定越好。一套数量较少且明确的参考素材,比包含相互冲突的主题、镜头风格和音频提示的杂乱无章的请求更容易解读。.
MiniMax H3 定价与每条视频的实际成本
MiniMax 在“按使用量付费”API 定价中列出了 H3。该 官方定价页面 按生成秒数计费,因此持续时间会对输出成本产生直接且可预测的影响。.
| 输出 | 官方汇率 | 5 秒钟 | 10 秒钟 | 15 秒 | 可用性 |
|---|---|---|---|---|---|
| 2K | $0.13/秒 | $0.65 | $1.30 | $1.95 | 显示为“有货” |
| 768P | $0.09/秒 | $0.45 | $0.90 | $1.35 | 封闭测试;请联系销售部门 |

2K输出成本
较长的片段以每秒 $0.13 的速率线性缩放
根据 MiniMax 官方公布的每秒 API 调用率计算得出。.
这些总数仅涵盖生成的内容。可能还会产生额外的参考图片和参考视频费用。.
上文提到的5秒、10秒和15秒的总计是根据MiniMax的每秒费率计算得出的,并非单独的套餐价格。在2K的情况下,计算公式很简单:时长 × $0.13。 如果需要经过数代迭代才能获得可用的结果,那么一次失败的实验仍可能影响经济效益。.
- 参考音频标注为免费。.
- 前五张参考图片免费;每增加一张图片需支付 $0.04。.
- 参考视频的计费依据是其输入时长,并按所选输出分辨率的帧率计算。.
- MiniMax 现有的预付费 Hailuo 视频套餐目前尚不支持 H3。.
包的排除规则很重要。该 官方视频合集页面 称目前尚不支持H3,因此买家不应认为现有的Hailuo点数套餐适用于新机型。.

MiniMax H3 局限性与未解问题
- 官方示例均经过精心挑选。. 这些数据反映的是设计强度,而非正常失效率。1. 保留原始数字单位("%"),未转换为中文单位(如"%"→"%")。.
- 目前尚无独立的GlobalGPT研究结果。. 及时遵守、速度、重试次数和信用额度使用情况仍未得到核实。.
- 经过多次迭代,2K的成本可能会变得很高。. 一个15秒的输出量为$1.95,此数值不包含额外的参考材料费用。.
- 768P 目前仍处于封闭测试阶段。. 较低的费率并非普遍可选的选项。.
- 现有的视频套餐不包含H3。. 按量计费和预付费套餐的接入必须保持独立。.
- 质量问题依然存在。. 手部动作、面部表情、可读文本、物理效果、场景切换、原生音频以及角色一致性都需要可重复的测试。.
最关键的缺失部分并非又一项功能宣称,而是在H3及其相关模型上使用完全相同的提示词和输入数据进行的受控测试包。在该测试包出现之前,一篇客观的MiniMax H3评测应当将该模型视为“前景可期”而非“已得到验证”。.
MiniMax H3 与 Hailuo 2.3:有哪些变化?
| 决策点 | MiniMax H3 | Hailuo 2.3 系列 |
|---|---|---|
| 定位 | 通用多模态视频模型 | 早期的 Hailuo 视频生成系列 |
| 参考输入 | 图片、视频和音频整合于一个内容结构中 | 这取决于具体的 Hailuo 型号和端点 |
| 输出时长 | 4–15秒 | 常见的选项包括6秒或10秒 |
| 输出分辨率 | H3 V2 API 中的 2K | 旧版价格表中列出了 768P 和 1080P 两种选项 |
| 账单 | $0.13/秒(2K) | 在列出的旧版示例中,每个片段为 $0.19–$0.56 |
| 预付费视频套餐 | 尚不支持 | 受现有 Hailuo 封装的支持 |
H3的设计似乎侧重于更丰富的参考素材、更长且灵活的处理时长,以及统一的多模态请求。Hailuo 2.3仍具备已建立的包支持这一优势。但这并不能证明H3生成的视频质量更高:只有匹配的输入和提示才能回答质量问题。.
希望对比更广泛市场的创作者还可以查看 最佳 AI 视频生成工具推荐, Kling 3.0 控制模块, 和 Seedance 2.0 接入路径 在选择一款长期使用的工具之前。.
如何访问 MiniMax H3
Hailuo AI Web
对于希望尝试 H3 却无需构建 API 工作流的创作者而言,Hailuo AI Web 是最简便的途径。 登录后,打开视频生成工作区,并在模型选择器中查找 MiniMax H3。可用性可能因账户或地区而异,因此请使用您当前工作区中显示的模型名称,不要假设每个账户的菜单都是一样的。.
官方 API 路径
官方流程采用异步 API。您需要提交生成请求,获取任务 ID,轮询任务状态,并在任务成功后从返回的 URL 下载结果。开发者还需为参考素材准备有效的公开媒体 URL 或上传的文件,并遵守 API 文档中关于大小、格式和角色的规定。.
GlobalGPT 航线:即将开通
MiniMax H3 即将登陆 GlobalGPT。 最终上线日期、计划访问权限、使用限制以及特定模型的 URL 尚未确定,因此本文不会对此进行推测。GlobalGPT 已经提供了一个多模型工作区,一旦该功能上线,这里将成为比较 H3 与其他视频和多模态模型的理想场所。.
如果您最看重的是使用多个模型,请浏览以下内容 人工智能视频替代品 在准备 H3 访问期间。.

MiniMax H3 评测结论
MiniMax H3 在初期就展现出了极具吸引力的卖点:2K 输出、4 至 15 秒的灵活片段长度、首帧和末帧控制,以及统一处理图像、视频和音频参考素材的方式。 参考系统是实际制作中最可能发挥关键作用的功能,因为它为创作者提供了更多方式来定义模型应保留的内容。.
需要注意的地方同样显而易见。官方演示无法体现正常的输出质量,而且当一个镜头需要多次拍摄时,每秒2K的费用可能会累积起来。如果参考控制对您的工作至关重要,那么H3值得尽早试用;但现在就断言它是大批量制作的最佳选择还为时过早。.
在 GlobalGPT 发布 H3 模型后,且该模型能够通过可重复的提示、输入、生成时间和成本记录进行测试,应更新最终评估结果。.
常见问题
什么是 MiniMax H3?
MiniMax H3 是一款多模态 AI 视频模型,可接受文本、图像、视频和音频参考素材。它支持文本转视频、首帧和末帧控制,以及基于参考素材的视频生成。.
MiniMax H3 能否生成 2K 视频?
是的。MiniMax 的官方 H3 文档中将 2K 列为 V2 API 的当前输出分辨率。仅凭分辨率本身并不能保证细节表现、动作一致性或提示词的准确性。.
MiniMax H3 视频最长可以多长?
MiniMax H3 支持以整数值形式生成的时长,范围为 4 至 15 秒。根据官方 API 费率(每秒 $0.13),生成 15 秒的 2K 内容需消耗 $1.95。.
MiniMax H3的价格是多少?
MiniMax 型号的 2K H3 生成速率为每输出秒 $0.13。列表中列出的 768P 速率为每秒 $0.09,但该选项目前处于封闭测试阶段,需联系销售部门。.
MiniMax H3 能否使用图像、视频和音频引用?
是的。参考生成功能可以将图片、视频片段和音频片段与所需的文本提示相结合。音频不能单独使用;至少需要一张参考图片或一段参考视频。.
MiniMax H3 是否包含在 MiniMax 视频套餐中?
目前还不行。MiniMax的官方视频套餐页面指出,当前的Hailuo视频套餐不支持MiniMax H3,因此不应将H3 API计费和预付费套餐积分视为同一访问途径。.
GlobalGPT 上是否支持 MiniMax H3?
MiniMax H3 即将登陆 GlobalGPT。具体上线日期、定价、使用限制及最终型号路线尚未确定,因此在发布具体的接入承诺前,请先查看实时平台详情。.
MiniMax H3 比 Hailuo 2.3 更好吗?
H3 提供了一种更新的多模态参考结构,时长灵活(4–15 秒),并支持 2K 分辨率输出。这些规格并不能证明其视频质量更优;要得出公正的结论,必须在两个模型上使用相同的提示词和输入数据。.



