DeepSeek V4 Pro 评测:有哪些变化、跑分、价格以及如何试用

DeepSeek V4 Pro 评测:测试、价格及试用指南
更新于2026年8月13日 独立实测评测

快速回答: DeepSeek V4 已正式发布,型号分别为 DeepSeek-V4-Pro-0813 和 DeepSeek-V4-Flash-0731。两者均支持 1M 令牌的上下文窗口,最大输出为 384K。 Flash 版本是低成本、高并发性的选择;Pro 版本虽然价格更高,但在我们最严苛的多约束任务中表现更为可靠。.

Pro-0813 Flash-0731 1M 上下文 最大输出 384K 思考 + 非思考

DeepSeek V4 Pro 现已作为量产机型推出,但在 2026 年 8 月的更新之后,在 Pro、Flash 和 Vision-Exp 这三款机型之间进行选择变得不再那么直观。这三款机型虽同属一个产品系列,但侧重的优先事项各不相同:分别是在复杂约束条件下的可靠性、成本与产量,以及图像输入。.

实际决策应从工作量入手。对于文本量大且对预算敏感的自动化任务,Flash 是明智的选择。当不一致的答复会导致昂贵的返工时,Pro 则更为合适。当输入内容包含图片时,请使用 deepseek-v4-flash-vision-exp 而不是仅限文本的模型。.

如果您希望将研究、写作、推理和编码辅助功能整合到一个工作流中,您可以访问 GlobalGPT. 此外,还有一条专门的路线用于 DeepSeek V4 Pro. 这是另一种接口方案;官方 API 的计费、限制和集成仍属于 DeepSeek 自身的环境。.

DeepSeek V4 是否已正式发布?

是的。DeepSeek 于 2026 年 8 月 13 日宣布 V4 Pro 正式发布。官方文档中将该量产型号标识为 DeepSeek-V4-Pro-0813. V4 Flash 显示为 DeepSeek-V4-Flash-0731, ,而该实验性视觉模型于8月21日作为 deepseek-v4-flash-vision-exp.

  • V4 Pro: 一种旨在处理更复杂任务的文本模型。.
  • V4 快讯: 一种针对成本和篇幅进行优化的文本模型。.
  • V4 Flash Vision-Exp: 一种支持图像的实验性变体。.

“全面可用”并不意味着每款产品或提供商都提供相同的接口、配额或集成方式。关于 API 的决策,请参考官方 机型与价格 页面和该 GA 发布说明.

质量等级

DeepSeek V4 Pro

版本: Pro-0813

最合适的: 更复杂的编码、智能体、推理以及约束条件繁多的交付成果。.

能效等级

DeepSeek V4 闪存

版本: Flash-0731

最合适的: 高吞吐量生产、常规编码、检索以及对成本敏感的工作负载。.

这些名称可能会让人感到困惑,因为 V4 技术报告描述的是预览版本,而正式 API 则使用的是过时的生产版本。在本篇评测中,除非某句话明确标注为“V4 预览版”,否则“Pro”指 Pro-0813,“Flash”指 Flash-0731。”

官方价格和规格
DeepSeek V4 Pro 和 Flash 的官方版本、上下文限制、功能及 API 价格
DeepSeek API 文档中列出了 V4-Pro-0813 和 V4-Flash-0731,其上下文大小为 1M,并标注了截至 2026 年 8 月 13 日的令牌价格。价格会动态变化,发布前应重新核对。.
官方发布历史
DeepSeek V4 Flash 7月31日官方更新及代理基准测试说明
7月31日的更新记录了Flash、基准测试设置以及对Codex的支持。其中“Pro版本即将推出”的表述是历史版本说明,并非8月13日的最新状态。.

DeepSeek V4 Pro 有哪些变化?

最明显的变化在于规模、上下文容量、面向代理的接口以及两级产品战略。DeepSeek的 官方Pro型号卡 该模型是一种专家混合模型,总参数数达1.6万亿,有效参数数为490亿,采用MIT许可证发布。随附的V4材料介绍了旨在实现百万令牌处理可行性的新型注意力机制和路由机制研究。.

  • 目前有两个等级: Pro 适用于对质量要求较高的工作,而 Flash 则侧重于吞吐量和成本。.
  • 工作记忆容量大幅增加: 为这两个模型都指定了一个包含1M个令牌的上下文窗口。.
  • 发电上限较高: 官方规范中规定,输出令牌数量最多可达384K。.
  • 代理接口: 工具调用、JSON 输出、响应 API 以及与 Anthropic 兼容的访问方式。.
  • 公开组体重: 虽然已提供官方的 V4 模型卡和文件,但大规模本地部署仍是一项重大的基础设施项目。.

这种组合使得V4在仓库级编码、长篇研究资料包以及多步骤代理追踪等场景中具有重要意义。这也改变了竞争格局:如今,有意义的评估不能仅局限于聊天质量,还需考察模型在工具辅助、严格格式和长输入条件下的表现。我们的 DeepSeek 与 ChatGPT 的对比 进一步阐述了这些生态系统在哪些方面存在差异。.

官方模特卡
官方 DeepSeek V4 Pro Hugging Face 模型卡及公开权重
官方型号卡上标明了型号 DeepSeek-V4-Pro、MIT 许可协议、1.6T/49B 设计以及对 100 万个代币的支持。.

DeepSeek V4 Pro 与 Flash 的对比:实际差异

这两个版本提供的标题上下文和输出限制相同,因此这并非“全模型与短上下文模型”之间的选择。这主要是一个关于质量、价格和容量规划的决策。 Flash 的官方并发上限是 Pro 的五倍,而 Pro 的缓存未命中输入和输出令牌的成本则略高于 Pro 的三倍。.

规格对比表

Pro 与 Flash 一览

闪光灯专业
当前版本
闪光灯Flash-0731
专业Pro-0813
上下文窗口
闪光灯100 万代币
专业100 万代币
最大输出
闪光灯384K 个代币
专业384K 个代币
思维模式
闪光灯思考与不思考
专业思考与不思考
官方并发上限
闪光灯2,500
专业500
缓存未命中次数 / 1M
闪光灯$0.14
专业$0.435
输出 / 1M
闪光灯$0.28
专业$0.87
我们观察到的最显著优势
闪光灯编码运行速度更快;令牌使用量更低
专业完美的严格备忘录得分

官方规格和价格信息核对于2026年8月13日;实际测试结果基于每项任务各进行一次测试,并非官方基准测试数据。.

更低的成本 + 规模效应

在以下情况下选择 Flash……

无论您需要的是低成本的大规模处理、常规代码修复、数据提取、分类,还是大量并行请求——您都可以验证高风险的算术运算和格式约束。.

更高的保障

在以下情况下选择“专业版”……

该结果综合考虑了代码、政策、财务以及诸多精确约束条件,而由此产生的额外成本远低于一次细微失误所造成的损失。.

实践测试:编码、检索和约束遵循

我们于2026年8月13日通过同一个兼容Broly Anywhere OpenAI的端点,对这两个API模型ID进行了测试。 温度为0。每个评分结果均代表每个模型和任务的一次运行。实际耗时包含网关和上游延迟,因此仅供参考——并非稳定的延迟排名。.

每个模型和任务各运行一次

实践评分表

观察数据,非官方数据
代理编码
8/8 8/8

Pro 和 Flash 都通过了所有已修复的测试。.

20.7K 档案
22/22 22/22

两个答案以及所有要求的记录引用均正确。.

严格备忘录
12/12 8/12

Pro 符合所有规则;Flash 未满足算术和长度限制。.

测试 1:基于代理的 Python 调试

该工具包在一个由三个文件组成的小型 Python 定价项目中,为每个模型提供了四种工具——列表文件、读取文件、写入文件以及运行测试。这比在聊天中请求代码片段更接近于代理的工作流。.

测试 1 / 代理编码

对一个 Python 定价项目进行调试、修补和验证

可编辑且可重复使用——在运行前请检查输入内容。.准备复制

这两个模型都遵循了相同的六步调用路径,仅对实现部分进行了修改,并生成了 8 通过. Flash 仅用 47.378 秒就完成了这次运行,而 Pro 则用了 95.228 秒,且 Flash 消耗的返回令牌更少。在此轮比拼中,没有哪一方在质量上胜出。如需了解另一种侧重代码的视角,请参阅我们的 DeepSeek 与 ChatGPT Python 编程测试.

实践测试 1 / 代理式编码
DeepSeek V4 Pro 在代理式 Python 调试任务中的 V4 Pro 和 Flash 模型结果
这两款机型均在一次运行中通过了8项固定测试。测试时间包含网关和上游延迟,并非官方基准测试。.

测试 2:约 20.7K 令牌的档案检索

我们附上了一份资料汇编,其中包含180多条记录、重复的干扰项、过时的草稿以及十条零散的事实。该模型必须以精确的十行格式作答,并且每条答案都需引用一条记录。.

测试 2 / 检索

用准确的引用来回应一份内容杂乱的文件

可编辑且可重复使用——在运行前请检查输入内容。.准备复制

这两个模型均获得22/22分:10个正确答案、10个正确引用,以及2个格式分。 Pro在10.396秒内完成了本次测试,Flash则用了21.737秒。实际提示词的使用量约为20.7K个令牌。这使其成为一项有用的中等长度检索测试,但它确实 验证完整的 1M 令牌窗口。.

实操测试 2 / 检索
DeepSeek V4 Pro 在 20K 令牌文件检索任务上的 Flash 结果
这两款模型都获得了22/22的分数。实际提示词的使用量约为20.7K个令牌;这并非1M上下文测试。.

测试3:一份严格的发射决策备忘录

该任务结合了120–180词的摘要、一个精确的四行表格、已知风险和未知计数、一项简短决策、有效的JSON,以及基于财务、法律、工程、销售、支持和安全备注的第一年成本计算。.

测试 3 / 约束跟踪

编写一份包含计算内容和严格输出规则的发布备忘录

可编辑且可重复使用——在运行前请检查输入内容。.准备复制

在 2,048 个完成令牌的限制下,两个模型均将可用完成预算用于返回的推理过程,但未生成任何可见答案。我们保留了这些记录,随后将提示词保持不变,并以 8,192 个令牌的限制重新运行了实验。 Pro 得分为 12/12。Flash 得分为 8/12,因为它报告的数值是 $217,100 而不是 $216,900,将 $200 的错误带入了方差计算中, 且生成的摘要为94个单词,而非要求的120–180个单词。.

实践测试 3 / 约束跟踪
DeepSeek V4 Pro 和 Flash 在约束决策备忘录中的结果
在进行2,048个令牌的截断处理并保持提示词不变的情况下,Pro模型在8,192个令牌的重新运行中获得了12/12的得分,Flash模型则获得了8/12的得分。.

这一结论具有特定性,而非普适性:Flash 在编码和检索任务上本就表现优异,而 Pro 在算术、结构和策略约束最为密集的组合场景下则更为稳健。如果您的工作流程依赖于代理外壳,我们的 OpenClaw 与 Claude、Code 与 OpenCode 的对比 有助于使模型与周围的工具相匹配。.

DeepSeek V4 性能测试:官方数据揭示了什么

最安全的基准测试来源是 DeepSeek V4 技术报告, ,但其中的表格和图表描述的是 V4 Preview 模型。这些内容有助于理解该架构的设计目标和测试环境;它们并非针对过时的 Pro-0813 API 版本的独立评分。.

证据边界

预览分数并非 Pro-0813 分数

官方报告
V4 预览

来自 DeepSeek 的架构和基准测试数据。.

当前 API
0813 / 0731

API 文档中列出的过时生产版本。.

请勿合并
预览版 ≠ 专业版

预览成绩不能重新标记为 Pro-0813 成绩。.

7月31日的Flash更新还公布了代理的测试结果,并列出了测试框架、设置以及Codex支持情况。这些细节至关重要,因为跨厂商的排行榜可能会因测试框架、推理预算、工具定义和重试规则的不同而发生变化。仅凭测试结果而未提供测试框架,尚不足以宣布一个无条件的赢家。.

出于同样的原因,我们的三项任务是作为官方证据的补充,而非取代它。它们向您展示了在某种已公开的设置下发生了什么。如果您要比较的是代理产品,而非仅仅是模型 API,那么我们的 Codex 与 Claude 代码指南 解释了为什么周围的工作流程会影响用户体验。.

DeepSeek V4 API 定价

DeepSeek在上线时的API定价异常激进。下表列出了2026年8月13日查阅到的官方每百万代币定价数据。官方页面还警告称,未来价格将大幅上涨,因此请将这些数据视为上线初期的历史数据。.

官方应用程序接口定价

每100万枚代币的价格

核查日期:2026年8月13日
缓存命中输入
闪光灯$0.0028
专业$0.003625
比率1.29×
缓存未命中输入
闪光灯$0.14
专业$0.435
比率3.11×
输出
闪光灯$0.28
专业$0.87
比率3.11×

以这些费率计算,一个包含1000万个输入令牌和200万个输出令牌的简单非缓存工作负载,在Flash上的费用为$1.96,在Pro上的费用为$6.09。该示例未考虑缓存命中、服务商加价、重试以及后续的任何价格变动。 各团队在比较供应商时,应采用统一的令牌组合和计费标准;我们的 Claude Opus 4.6 API 定价指南 说明了为什么输入、输出和缓存需要分别放在不同的行中。.

1M上下文窗口的含义——及其局限性

100万令牌的上下文窗口是一种容量限制,而非对每个位置都能实现完美召回率的承诺。它为 API 提供了处理超大规模存储库、文档集合、研究资料包或代理历史记录的空间。质量问题在于:当相关证据被埋没在数十万个干扰性令牌之中时,模型能否检索到正确的细节。.

DeepSeek的预览报告中包含了一张多轮指代消解(MRCR)图表,涵盖了从8K到1M的输入令牌数量范围。 该曲线在较短长度下表现强劲,但在超过 128K 后开始下滑。这是长上下文处理困难的典型表现,因此“支持 1M”绝不应被解读为“在 1M 时无损”。”

预览基准边界
DeepSeek V4 预览:MRCR 在 8K 至 1M 个输入令牌范围内的检索性能
摘自《DeepSeek V4 Preview》技术报告的图9。该图展示了Preview的检索行为,并非独立的Pro-0813实验结果。.

API 接口本身也有其自身的限制。DeepSeek 的 响应 API 指南 描述了一种无状态的实现:诸如以下功能: 上一条回复的ID, 对话、商店和背景均不被支持。图像和文件输入也不被支持,因此您需要在模型外部提取文本或构建状态层。.

"(《世界人权宣言》) 兼容 Anthropic 的 API 表 同样,它也会将图像和文档消息的变体标记为不受支持。因此,兼容性意味着熟悉的请求格式和工具——而非与每个 Anthropic 模型或客户端在功能上完全一致。.

官方 API 限制
DeepSeek Anthropic API 兼容性对照表,列出了不支持的图片和文档输入
官方的“消息字段”表将图像和文档内容的变体标记为“不支持”。.

如何试用 DeepSeek V4 Pro 并进行刷机

您有三种实用的方案。请根据您的需求选择:是想进行快速对话、管理生产环境中的 API,还是使用多模型工作区。.

三种切实可行的途径

选择访问路径

没有哪一种方案能适用于所有工作流程
1号路线

DeepSeek Web/App

最适合通过 DeepSeek 自有的用户界面试用该模型。.

2号路线

官方应用程序接口

最适合代币计费、工具、JSON、代理框架和生产控制。.

3号路线

GlobalGPT

最适合在更广泛的多模型工作区中直接打开 Pro 或 Flash 文件,而无需先构建客户端。.

路线 1:DeepSeek 官方聊天群

从……开始 DeepSeek的官方网站 如果您只是想了解当前的用户体验。用户访问和 API 计费是分开的;即使提供了在线聊天界面,也不意味着该 API 是免费的。.

途径 2:官方 API 和编码代理

使用 deepseek-v4-prodeepseek-v4-flash 与已记录的 OpenAI 兼容接口。两者均支持“思考”模式和“非思考”模式、JSON 输出、工具调用、Responses API 以及 Anthropic 兼容访问。FIM 仅在“非思考”模式下适用。.

DeepSeek 还出版了一本 《Codex》官方整合指南. 如果您正在考虑先选择哪种代理外壳,请比较 Claude 代码的定价和使用限制 在假设模型代币成本就是整张账单之前。.

官方集成指南
Codex 版 DeepSeek V4 官方集成指南
DeepSeek 的官方 Codex 指南使用了 Responses API,并详细记录了 V4 模型的配置。.

Claude 代码用户可以遵循我们指南中所述的相同端点和模型逻辑,以 在 Claude Code 中配置模型, ,同时检查 DeepSeek 的实时兼容性表中是否存在不受支持的字段。.

路线 3:GlobalGPT

GlobalGPT 为这两种型号分别设有专用条目。已验证的转换路径是 DeepSeek V4 Pro 搭载于 GlobalGPT. 虽然也存在一个 Flash 产品页面,但我们未发现经过验证的、专门针对 Flash 的广告活动参数,因此我们不会自行编造一个。.

“已验证专业版”访问路径
DeepSeek V4 Pro 型号条目位于 GlobalGPT 内
GlobalGPT 提供了一个专用的 DeepSeek V4 Pro 条目。这确认了路由和显示的型号标识,而非基准测试性能。.
经过验证的 Flash 访问路径
DeepSeek V4 闪存型号条目位于 GlobalGPT 内
GlobalGPT 还提供了一个专用的 V4 Flash 条目。该图片链接至经过验证的 GlobalGPT 常规追踪路线,因为尚未验证出专门针对 Flash 的邀请者。.

对于终端工作流,该 在 Claude 代码设置中使用 GlobalGPT CLI 解释了多模型平台如何融入现有的编码流程。它不会取代原生仓库工具,而是改变了您访问和比较模型的方式。.

您应该选择哪款 DeepSeek V4 型号?

决策指南

根据故障成本选择合适的模型

最佳默认设置

闪光灯

推荐将其用于高吞吐量聊天、信息提取、常规代码处理、信息检索以及需要严格验证的智能代理。它以最低的官方价格完美通过了我们三项任务中的两项。.

更高的保障

专业

当严格的算术运算、格式规范、政策要求和多领域推理在同一份交付成果中交汇时,请选用该模型。它是唯一在我们的备忘录中获得12分(满分12分)的模型。.

最简单的试用版

GlobalGPT

如果您想试用该模型或比较不同选项,但不想先编写 API 客户端,请选择平台路径。.

对于许多团队而言,Flash 是最明智的首次部署选择:它成本更低,支持相同的声明上下文和输出限制,并且在我们的编码和 20.7K 次检索测试中均未出现质量问题。此外,还增加了对数字、模式和必填字段的确定性检查。.

当审核时间或失败成本超过使用代币节省的成本时,请升级至专业版。价格差距确实存在,但首次就能准确完成一份内容详实的合规或发布备忘录所带来的价值同样不容小觑。如果您的候选名单中还包括其他助手,那么更广泛的 DeepSeek 与 ChatGPT 选购指南 有助于将模型质量与产品生态系统区分开来。.

结论:DeepSeek V4 Pro 值得购买吗?

当工作更注重控制而非处理量时,值得考虑使用 DeepSeek V4 Pro。 它并非经济实惠的首选方案:在 API 中,无论在高峰期还是非高峰期,Pro 版本在主要缓存未命中输入和输出行上的成本都是 Flash 版本的三倍。但当错误的答案会导致返工、审查开销或运营风险时,这种额外成本就显得合理了。.

对于常规任务,Flash 在成本与规模之间提供了更简便的平衡。处理图像时,请使用 Vision-Exp。如果目标不是管理 API,而是要在研究、写作和技术支持之间切换,那么多模型工作区比单独配置每项服务更为实用。.

下一步

在同一个工作区中打开 DeepSeek V4 Pro,该工作区还汇集了其他用于研究、写作和编码辅助的模型。.

试用 DeepSeek V4 Pro

关于 DeepSeek V4 的常见问题

DeepSeek V4 Pro 已经发布了吗?

是的。DeepSeek V4 Pro 已于 2026 年 8 月 13 日正式发布,其生产标识符为 DeepSeek-V4-Pro-0813。.

DeepSeek V4 Pro 和 Flash 之间有什么区别?

Flash 侧重于成本和并发性,而 Pro 则专为具有更多约束且失败代价更高的文本任务而设计。两者均支持 100 万令牌的上下文窗口,最大输出为 384K 令牌。.

DeepSeek V4 Pro 的售价是多少?

每100万个代币,非高峰时段的Pro定价为:缓存命中输入为$0.022,缓存未命中输入为$0.66,输出为$1.98。 高峰时段的价格分别为$0.044、$1.32和$3.96。.

API的峰值时段是什么时候?

高峰时段为周一至周五的协调世界时(UTC)01:00-04:00 和 06:00-10:00。其余时段均按非高峰时段费率计费。.

DeepSeek V4 支持导入图片吗?

deepseek-v4-flash-vision-exp 支持图像格式。官方指南中列出了 JPEG、PNG、GIF 和 WebP 格式。Pro 和 Flash 文本模型应分别处理。.

100万个令牌的上下文窗口能否保证完美检索?

不。100万个令牌的范围仅描述了处理能力。检索结果仍取决于文档结构、事实位置、提示词以及验证方法。.

我可以在 Codex 上使用 DeepSeek V4 吗?

是的。官方文档中描述了通过 Responses API 实现的集成,并列出了 Flash、Pro 和 Vision-Exp 作为模型选项。.

如何在不配置 API 的情况下试用 DeepSeek V4 Pro?

您可以使用提供该模型的接口,例如 GlobalGPT。该方案适用于聊天、研究、写作和技术支持;其计费方式和功能与官方 API 控制台并不完全相同。.

分享帖子:

相关帖子