Gemini 3.6 Flash 这一举措并未悄无声息地推出。谷歌将其作为一款更快、更高效的 Flash 机型发布,但许多人的反应却如出一辙:等等,Pro 版升级呢?
这使得这种对比比普通的规格表更有趣。. Gemini 3.6 Flash 据称在编码、智能体开发以及日常多模态工作中,它更经济、更快、更强大。. 双子座 3.1 Pro, 与此同时,它仍然冠以“Pro”之名,定位于更深入的推理和更复杂的任务。.
因此,我们采用了唯一真正有效的测试方法: 相同的任务、相同的提示、相同的输入、相同的评分规则。.
在本篇评测中,我们将通过实际任务对 Gemini 3.6 Flash 和 Gemini 3.1 Pro 进行对比:r研究综述、代码修复、长篇文本摘要、数据推理、截图分析以及SEO文案撰写。. 每一轮的核心问题都很简单:哪种输出结果更容易让人信任、编辑和重复使用?
Gemini 3.6 Flash 被标记为“稳定版”;Gemini 3.1 Pro 则标记为“预览版”。.
根据标准付费 API 定价,每 100 万个输出代币,不包括长提示词的 Pro 级服务。.
Flash 在四项任务层面的编辑决策中胜出;Pro 则在研究综合分析和截图分析中胜出。.
如果您想比较不同型号,又不想打开一大堆单独的标签页,可以从 GLBGPT 模型中心 在相信任何发布声明之前,应将同一提示语应用于多个AI模型进行测试。这对这类评测至关重要,因为比较模型的唯一公正方式,就是让它们处理相同的工作,并观察其输出结果。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro 快速对比
在我们针对同一提示词进行的 API 测试中,Gemini 3.6 Flash 在整体实际表现上更胜一筹: 它在六项任务级别的编辑评估中赢得了其中四项,并在多项实际任务中生成了更简洁的初稿。.
Gemini 3.1 Pro Preview 生成了更适合发布的、符合 SEO 风格的研究建议,并提供了更丰富的截图审核报告。Flash 在处理编码、长篇内容、数据推理和 SEO 编辑任务方面表现更为出色。.
Flash 在编码、长篇文本摘要、数据推理和 SEO 编辑方面的表现更为出色,同时其初稿也更易于重复利用。.
Pro 给出了更清晰、基于数据分析的回答,并提供了更详细的截图审核,特别是在答案需要更深入的分析时。.
本次运行使用了六个受控的 API 任务。这并不能证明每个生产工作负载、提供商路由或长上下文层都会表现出相同的行为。.
Gemini 3.6 Flash 与 Gemini 3.1 Pro 官方规格对比
谷歌宣布 Gemini 3.6 2026年7月21日发布, ,以及 Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。 在该发布帖中,谷歌将 3.6 Flash 定位为一款在编码、知识工作、多模态性能以及代理工作流方面更高效的 Flash 模型。若您考虑的候选名单中还包括此次发布中的低成本模型,我们的 Gemini 3.5 Flash-Lite 评测 对此另有说明。.
Gemini API 的官方型号页面将该型号代码列为 gemini-3.6-flash. 该模型标记为“稳定版”,支持文本、图像、视频、音频和 PDF 输入,并返回文本输出。列出的令牌限制为 1,048,576 个输入令牌和 65,536 个输出令牌。若想了解除此次正面对比测试之外的纯模型评估,请阅读我们的完整 Gemini 3.6 闪评.
Gemini 3.1 Pro 是一款与众不同的机型。谷歌宣布 Gemini 3.1 Pro,2026年2月19日, ,将其定位于处理复杂任务和高级推理。谷歌表示,该模型正在推出预览版,以便在正式发布前验证更新内容。.


在比较 API 时,精确的标签至关重要。官方模型页面使用的是 gemini-3.1-pro-preview, ,并非稳定的 Pro 标签。其列出的输入和输出代币限制与 Gemini 3.6 Flash 相同:1,048,576 个输入代币和 65,536 个输出代币。阅读规格说明后,若要尝试 Pro 功能,请打开 Gemini 3.1 Pro 产品页面 并运行本文中提到的其中一个相同命令。.
如果您需要的是配置指南,而不是原始模型代码的说明,那么 Gemini 3.1 Pro 使用指南 这是在开始测试提示词之前更简洁的下一步。.

gemini-3.6-flash 该合约被标记为“稳定”,其输入窗口为1M个代币。.
gemini-3.1-pro-preview 被列为“预览版”,其输入/输出限制与原版相同。.Gemini 3.6 Flash 与 Gemini 3.1 Pro 价格对比
对于标准的付费 Gemini API 使用,Gemini 3.6 Flash 的价格比 Gemini 3.1 Pro Preview 更便宜。该 Gemini API 定价页面 列出了 Gemini 3.6 Flash,其费用为每 100 万输入代币 $1.50,每 100 万输出代币 $7.50。.
Gemini 3.1 Pro 预览版设有两个标准定价档位。对于不超过 200K 令牌的提示词,每 1M 输入令牌的定价为 $2.00,每 1M 输出令牌的定价为 $12.00。 对于超过 200K 令牌的提示词,价格将上调至每 100 万输入令牌 $4.00,每 100 万输出令牌 $18.00。如需查看 Pro 版本的具体费用明细,请保留 Gemini 3.1 Pro 价格指南 在桌子旁边打开。.
| 模型 | 标准投入价格 | 标准产出价格 | 重要说明 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 / 1M 代币 | $7.50 / 1M 代币 | 稳定币模型;输出价格包含思考代币 |
| 双子座 3.1 预览版 | $2.00 / 20万提示词令牌以下的100万令牌 | $12.00 / 1M 个代币(提示词代币少于 200K 个) | 预览模型;提示词令牌数超过 200K 时,将适用更高级别 |
| Gemini 3.1 Pro 预览版,长提示词 | $4.00 / 超过 200K 提示符令牌的 1M 个令牌 | $18.00 / 超过 200K 提示令牌的 1M 个令牌 | 对长上下文测试至关重要 |
价格本身并不能决定模型的质量。一款价格较低但需要更多重试次数的模型,实际使用起来可能反而更昂贵。如果一款速度较慢的模型能在高价值任务中避免给出错误答案,那么它仍然物有所值。如果您的提示词经常导致上下文过长或超出配额,请检查 Gemini 3.1 Pro 限制指南 在将价格视为决定性因素之前。这就是为什么我们的测试会针对每条提示同时记录成本和结果质量。.
Gemini 3.6 Flash 与 Gemini 3.1 Pro 性能对比
谷歌的 Gemini 3.6 闪电发布帖 这使得该模型在效率方面表现突出。谷歌表示,在“人工分析指数”(Artificial Analysis Index)上,3.6 Flash 比 3.5 Flash 少消耗 17% 个输出令牌,其性能优于 DeepSWE 和 MLE Bench,并且与 3.5 Flash 相比,在 OSWorld 验证的性能上也有所提升。.
这是一个好兆头,但这并没有回答我们在此关心的那个问题。真正的问题不仅在于3.6版Flash与之前的版本相比如何, Gemini 3.5 闪评; ;关键在于,3.6 Flash 是否能在实际的同提示任务中与 Gemini 3.1 Pro 一较高下。.
Gemini 3.1 Pro 的官方跑分表现则有所不同。在 Gemini 3.1 Pro 发布帖, 谷歌重点介绍了其先进的推理能力,并表示 3.1 Pro 在 ARC-AGI-2 测试中获得了 77.1% 的经核实分数。这让人很容易推测 Pro 应该能在难度更高的推理测试中胜出。但本文正是试图避免此类推测。.
第三方 人工分析对比 我们收集的数据显示出更为鲜明的对比:Gemini 3.6 Flash 似乎比 Gemini 3.1 Pro Preview 运行更快、成本更低,且智能指数更高。这虽是有用的参考信息,但并非谷歌的官方结果,且仍无法替代基于相同提示词的测试。.

| 资料来源 | 公制 | Gemini 3.6 Flash | 双子座 3.1 预览版 | 使用方法 |
|---|---|---|---|---|
| 谷歌官方 | DeepSWE | 49% | 在关于 3.6 Flash 发布的帖子中,并未直接与 3.1 Pro 进行对比 | 官方声明主要将3.6版Flash与3.5版Flash进行了对比 |
| 谷歌官方 | MLE 长凳 | 63.9% | 在关于 3.6 Flash 发布的帖子中,并未直接与 3.1 Pro 进行对比 | 适用于编码/代理模型的预期,并非最终证明 |
| 谷歌官方 | OSWorld-Verified | 83.0% | 在关于 3.6 Flash 发布的帖子中,并未直接与 3.1 Pro 进行对比 | 适用于计算机使用场景 |
| 人工分析 | 智力指数 | 50 | 46 | 第三方基准测试背景 |
| 人工分析 | 输出速度 | 280 个代币/秒 | 119 个代币/秒 | 第三方速度上下文 |
| 人工分析 | 获得第一个代币所需的时间 | 11.71秒 | 33.44秒 | 第三方延迟上下文 |
| 人工分析 | 综合价格 | $1.16 / 1M 个代币 | $1.74 / 1M 代币 | 请勿与官方 API 定价混用 |
数据图:人工智能分析快照
第三方对比数据采集于2026年7月22日。请将此作为参考依据,而非谷歌的官方声明。.
我们如何对 Gemini 3.6 Flash 与 Gemini 3.1 Pro 进行测试
每次测试中,两个模型均使用相同的提示、相同的输入以及相同的评分标准。我们不会将一个模型给出的正确答案视为该模型在整体上更优的证明。我们的目标更为具体且更具实用价值:展示每个模型在具体任务中的表现。.
我们根据以下类别对每项输出结果进行了评分:
| 类别 | 我们的考察重点 |
|---|---|
| 结果质量 | 这个答案真的能用吗? |
| 操作说明如下 | 该模型是否符合格式、限制和约束条件? |
| 准确性 | 它是否避免了虚构的事实、价格、链接或主张? |
| 推理深度 | 它是否考虑到了权衡和隐含的约束条件? |
| 结构 | 输出内容是否便于浏览和重复使用? |
| 速度 | 端到端响应时间(单位:秒) |
| 费用 | 根据官方 API 输入/输出代币定价估算得出 |
该测试通过相同的 API 路由,使用完全相同的请求模型 ID 进行: gemini-3.6-flash 和 gemini-3.1-pro-preview. 每项任务的原始输出、令牌使用量、延迟以及官方API成本估算均被记录下来。.
如果编程是你比较这两款机型的主要原因,请将这一结果与 最适合编码的人工智能模型 请以此为参考,而不是仅凭一条错误修复提示就妄下结论。.
如果你仍在为更广泛的工作选择一个默认模型,那么 最佳AI模型指南 这比单独阅读这组Gemini资料要好得多。.
而且,如果你真正要抉择的是 Google 与 OpenAI 之间,而不是 Flash 与 Pro 之间,那么 GPT-5 与 Gemini 2.5 Pro 对比 这比再制作一张仅包含Gemini数据的基准表要好。.
Pro的推荐内容读起来更像是一篇经过精心打磨的SEO团队文案,尽管其中一条矩阵注释错误地标注了来源包。.
专业两者都解决了这个问题,但 Flash 在测试中对小数值的断言更为严格。.
闪光灯Pro 功能更丰富,但 Flash 在预览状态的表述上更简洁、更安全。.
闪光,微弱两者的数学运算都是正确的;Flash 采用了更常见的除法符号,并且结构更简洁,更便于扫描。.
闪光灯Flash 的信息准确无误;Pro 则提供了更详尽的信任度、排版及移动端风险详情。.
优点,轻微Flash听起来更自然、更清澈;Pro虽然稳妥,但音色过于夸张。.
闪光灯Gemini 3.6 Flash 与 Gemini 3.1 Pro 基于相同提示词的生成结果
本节并未将测试数据隐藏在一张综合评分卡中,而是将每个提示分别展示为独立的“Gemini 3.6 Flash 与 Gemini 3.1 Pro”对比卡。 每张对比卡都包含同一提示词的API运行数据,以及实际原始输出结果的简短摘录,因此该对比不仅仅是一张分数表。.



Gemini 3.6 Flash 与 Gemini 3.1 Pro:最终评测
Gemini 3.6 Flash 在此次对比中拔得头筹,在六项相同提示的任务中赢得了其中四项。. 其表现最突出的领域包括编码、长文本摘要、数据推理和SEO编辑。Gemini 3.1 Pro Preview 仍能生成更优质的研究综述和更详细的截图审核报告,这表明当任务更注重深度时,Pro 模型能够给出更精炼或更细致的答案。.
在此次受控的API运行中,Flash的表现也更快、成本更低。这一组合使其在此处取得了更优异的整体结果,但并不能完全取代Pro:实际输出结果表明,即使提示词完全相同,模型质量仍会因任务的不同而有所变化。.
为了你自己 Gemini 3.6 Flash 与 Gemini 3.1 Pro 对比 为了进行比较,请将同一条真实提示语分别输入到这两个模型中,在 GLBGPT 并将完成的作品并排进行比较。.
Gemini 3.6 Flash 与 Gemini 3.1 Pro 常见问题解答
Gemini 3.6 Flash 是什么时候发布的?
谷歌 于2026年7月21日发布了Gemini 3.6固件. Gemini API 型号的官方页面列出了 gemini-3.6-flash 作为一种稳定的模型。.
Gemini 3.1 Pro 和 Gemini 3.1 Pro Preview 是同一个版本吗?
有关 API 的定价和技术对比,请参考官方说明 gemini-3.1-pro-preview. 谷歌在2026年2月的发布公告中表示,Gemini 3.1 Pro已以预览版形式发布,旨在在正式发布前对更新进行验证。.
Gemini 3.5 Pro 或 Gemini 3.6 Pro 什么时候发布?
截至2026年7月22日,谷歌已就Gemini 3.5 Pro发表了官方声明,但并未承诺具体的发布日期。在 Gemini 3.6 闪电公告, 谷歌表示,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,并计划“一经准备就绪”便广泛推出该版本。我未找到关于 Gemini 3.6 Pro 的谷歌官方发布日期或官方公告。.
Gemini 3.6 Flash 是否取代了 Gemini 3.1 Pro?
并非官方说法。Gemini 3.6 Flash 是一款注重速度、成本、编码、多模态工作以及主动式执行的稳定版 Flash 模型。Gemini 3.1 Pro Preview 则侧重于更高级的推理和复杂任务。 本文中的同提示测试旨在展示当前实际应用中的差距所在。.
公开基准测试能决定胜负吗?
不。基准测试有助于设定预期,但不能替代在受控条件下使用相同提示进行的测试。本文将官方基准测试声明、第三方基准测试数据以及我们自己的任务级测试结果进行了区分。.
为什么这篇文章使用“Gemini 3.1 Pro Preview”而不是直接写“Gemini 3.1 Pro”?
文章在面向读者的正文中可以使用“Gemini 3.1 Pro”,但在技术表格中应使用 gemini-3.1-pro-preview. 这是 Gemini 型号和定价页面中使用的官方 API 标签。.
Gemini 3.6 Flash 比 Gemini 3.1 Pro Preview 更便宜吗?
是的,这属于标准付费 Gemini API 定价范围。Gemini 3.6 Flash 的定价为:每 100 万个输入令牌 $1.50,每 100 万个输出令牌 $7.50。 Gemini 3.1 Pro Preview 的起始价格为每 100 万个令牌 $2.00(输入)和 $12.00(输出),对于超过 20 万个令牌的提示词,则适用更高档次的定价。.
这两个模型都支持 1M 个令牌的上下文窗口吗?
Gemini API 的官方模型页面显示,这两者的输入令牌数均为 1,048,576 个 gemini-3.6-flash 和 gemini-3.1-pro-preview. 实际上,长上下文测试仍然很重要,因为较大的窗口并不能保证完美的召回率。.
这篇文章应该包含官方截图吗?
是的,但截图应仅用于佐证论点,而非替代整篇文章的内容。主要对比内容应通过易于阅读的表格、数据卡片、价格柱状图、基准测试摘要以及基于相同提示的测试结果表来呈现。.
“同一提示”测试中包含了哪些任务?
此次 API 运行包含六项任务:研究综述、代码错误修复、长文本摘要、数据推理、截图分析以及 SEO 写作/编辑。每次运行都会记录延迟、输入令牌数、输出令牌数、预估成本以及评委评语。.
这篇文章能说 Gemini 3.6 Flash 比 Gemini 3.1 Pro 更好吗?
可以这样说:在这次针对相同提示词的API测试中,Gemini 3.6版本的Flash表现更佳。但不应断言Flash在所有工作负载下都更胜一筹,因为Pro在研究综述和截图分析方面取得了更优异的成绩。.
相同提示的测试是在哪里进行的?
这些测试是通过相同的 API 路由,使用完全相同的模型 ID 执行的 gemini-3.6-flash 和 gemini-3.1-pro-preview. 这不是一项 GLBGPT UI 测试,且本地计时应理解为端到端请求时间,而非提供商侧的延迟。.
既然“Pro”在某些质量类别的评选中获胜,为什么“Gemini 3.6 Flash”却获得了总冠军?
Flash 获胜是因为它在更多任务中给出了更出色的可复用答案。Pro 在研究综述和截图分析方面表现更强,但 Flash 的胜出涵盖了编码、长篇文本摘要、数据推理和 SEO 编辑等任务。.
为什么要在比较中提到GLBGPT?
当读者能够在一个地方测试多个模型时,模型比较就会变得更加容易。GLBGPT在此具有重要意义,因为读者的下一步行动不仅仅是阅读规格说明,而是将同一条提示语应用于不同模型,并比较各模型的输出结果。.

