Gemini 3.6 Flash 与 Gemini 3.1 Pro 对比:价格、跑分及 6 项相同提示词测试

Gemini 3.6 Flash 与 Gemini 3.1 Pro 对比

Gemini 3.6 Flash 这一举措并未悄无声息地推出。谷歌将其作为一款更快、更高效的 Flash 机型发布,但许多人的反应却如出一辙:等等,Pro 版升级呢?

这使得这种对比比普通的规格表更有趣。. Gemini 3.6 Flash 据称在编码、智能体开发以及日常多模态工作中,它更经济、更快、更强大。. 双子座 3.1 Pro, 与此同时,它仍然冠以“Pro”之名,定位于更深入的推理和更复杂的任务。.

因此,我们采用了唯一真正有效的测试方法: 相同的任务、相同的提示、相同的输入、相同的评分规则。.

在本篇评测中,我们将通过实际任务对 Gemini 3.6 Flash 和 Gemini 3.1 Pro 进行对比:r研究综述、代码修复、长篇文本摘要、数据推理、截图分析以及SEO文案撰写。. 每一轮的核心问题都很简单:哪种输出结果更容易让人信任、编辑和重复使用?

API 状态 稳定版与预览版

Gemini 3.6 Flash 被标记为“稳定版”;Gemini 3.1 Pro 则标记为“预览版”。.

官方出厂价 $7.50 与 $12+ 对比

根据标准付费 API 定价,每 100 万个输出代币,不包括长提示词的 Pro 级服务。.

我们针对同一提示词的运行结果 4胜对2胜

Flash 在四项任务层面的编辑决策中胜出;Pro 则在研究综合分析和截图分析中胜出。.

如果您想比较不同型号,又不想打开一大堆单独的标签页,可以从 GLBGPT 模型中心 在相信任何发布声明之前,应将同一提示语应用于多个AI模型进行测试。这对这类评测至关重要,因为比较模型的唯一公正方式,就是让它们处理相同的工作,并观察其输出结果。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro 快速对比

在我们针对同一提示词进行的 API 测试中,Gemini 3.6 Flash 在整体实际表现上更胜一筹: 它在六项任务级别的编辑评估中赢得了其中四项,并在多项实际任务中生成了更简洁的初稿。.

Gemini 3.1 Pro Preview 生成了更适合发布的、符合 SEO 风格的研究建议,并提供了更丰富的截图审核报告。Flash 在处理编码、长篇内容、数据推理和 SEO 编辑任务方面表现更为出色。.

3.6 Flash 目前的发展方向 初稿的实用性

Flash 在编码、长篇文本摘要、数据推理和 SEO 编辑方面的表现更为出色,同时其初稿也更易于重复利用。.

3.1 Pro 仍能胜出的领域 清晰的推理与更深入的用户界面分析

Pro 给出了更清晰、基于数据分析的回答,并提供了更详细的截图审核,特别是在答案需要更深入的分析时。.

尚未确定的事项 耗时更长、风险更高的任务

本次运行使用了六个受控的 API 任务。这并不能证明每个生产工作负载、提供商路由或长上下文层都会表现出相同的行为。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro 官方规格对比

谷歌宣布 Gemini 3.6 2026年7月21日发布, ,以及 Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。 在该发布帖中,谷歌将 3.6 Flash 定位为一款在编码、知识工作、多模态性能以及代理工作流方面更高效的 Flash 模型。若您考虑的候选名单中还包括此次发布中的低成本模型,我们的 Gemini 3.5 Flash-Lite 评测 对此另有说明。.

Gemini API 的官方型号页面将该型号代码列为 gemini-3.6-flash. 该模型标记为“稳定版”,支持文本、图像、视频、音频和 PDF 输入,并返回文本输出。列出的令牌限制为 1,048,576 个输入令牌和 65,536 个输出令牌。若想了解除此次正面对比测试之外的纯模型评估,请阅读我们的完整 Gemini 3.6 闪评.

Gemini 3.1 Pro 是一款与众不同的机型。谷歌宣布 Gemini 3.1 Pro,2026年2月19日, ,将其定位于处理复杂任务和高级推理。谷歌表示,该模型正在推出预览版,以便在正式发布前验证更新内容。.

谷歌官方 Gemini 3.6 Flash 发布页面显示的发布日期为 2026 年 7 月 21 日。.
Gemini 3.6 快讯公告,摄于2026年7月22日。.
谷歌官方 Gemini 3.1 Pro 发布页面显示了 2026 年 2 月 19 日的公告。.
Gemini 3.1 Pro 发布公告,摄于 2026 年 7 月 22 日。.

在比较 API 时,精确的标签至关重要。官方模型页面使用的是 gemini-3.1-pro-preview, ,并非稳定的 Pro 标签。其列出的输入和输出代币限制与 Gemini 3.6 Flash 相同:1,048,576 个输入代币和 65,536 个输出代币。阅读规格说明后,若要尝试 Pro 功能,请打开 Gemini 3.1 Pro 产品页面 并运行本文中提到的其中一个相同命令。.

如果您需要的是配置指南,而不是原始模型代码的说明,那么 Gemini 3.1 Pro 使用指南 这是在开始测试提示词之前更简洁的下一步。.

Gemini API 模型页面显示,gemini-3.6-flash 是一个具有 1M 输入上下文窗口的稳定模型。.
gemini-3.6-flash 该合约被标记为“稳定”,其输入窗口为1M个代币。.
Gemini API 模型页面将 gemini-3.1-pro-preview 列为预览模型。.
gemini-3.1-pro-preview 被列为“预览版”,其输入/输出限制与原版相同。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro 价格对比

对于标准的付费 Gemini API 使用,Gemini 3.6 Flash 的价格比 Gemini 3.1 Pro Preview 更便宜。该 Gemini API 定价页面 列出了 Gemini 3.6 Flash,其费用为每 100 万输入代币 $1.50,每 100 万输出代币 $7.50。.

Gemini 3.1 Pro 预览版设有两个标准定价档位。对于不超过 200K 令牌的提示词,每 1M 输入令牌的定价为 $2.00,每 1M 输出令牌的定价为 $12.00。 对于超过 200K 令牌的提示词,价格将上调至每 100 万输入令牌 $4.00,每 100 万输出令牌 $18.00。如需查看 Pro 版本的具体费用明细,请保留 Gemini 3.1 Pro 价格指南 在桌子旁边打开。.

模型标准投入价格标准产出价格重要说明
Gemini 3.6 Flash$1.50 / 1M 代币$7.50 / 1M 代币稳定币模型;输出价格包含思考代币
双子座 3.1 预览版$2.00 / 20万提示词令牌以下的100万令牌$12.00 / 1M 个代币(提示词代币少于 200K 个)预览模型;提示词令牌数超过 200K 时,将适用更高级别
Gemini 3.1 Pro 预览版,长提示词$4.00 / 超过 200K 提示符令牌的 1M 个令牌$18.00 / 超过 200K 提示令牌的 1M 个令牌对长上下文测试至关重要

价格本身并不能决定模型的质量。一款价格较低但需要更多重试次数的模型,实际使用起来可能反而更昂贵。如果一款速度较慢的模型能在高价值任务中避免给出错误答案,那么它仍然物有所值。如果您的提示词经常导致上下文过长或超出配额,请检查 Gemini 3.1 Pro 限制指南 在将价格视为决定性因素之前。这就是为什么我们的测试会针对每条提示同时记录成本和结果质量。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro 性能对比

谷歌的 Gemini 3.6 闪电发布帖 这使得该模型在效率方面表现突出。谷歌表示,在“人工分析指数”(Artificial Analysis Index)上,3.6 Flash 比 3.5 Flash 少消耗 17% 个输出令牌,其性能优于 DeepSWE 和 MLE Bench,并且与 3.5 Flash 相比,在 OSWorld 验证的性能上也有所提升。.

这是一个好兆头,但这并没有回答我们在此关心的那个问题。真正的问题不仅在于3.6版Flash与之前的版本相比如何, Gemini 3.5 闪评; ;关键在于,3.6 Flash 是否能在实际的同提示任务中与 Gemini 3.1 Pro 一较高下。.

Gemini 3.1 Pro 的官方跑分表现则有所不同。在 Gemini 3.1 Pro 发布帖, 谷歌重点介绍了其先进的推理能力,并表示 3.1 Pro 在 ARC-AGI-2 测试中获得了 77.1% 的经核实分数。这让人很容易推测 Pro 应该能在难度更高的推理测试中胜出。但本文正是试图避免此类推测。.

第三方 人工分析对比 我们收集的数据显示出更为鲜明的对比:Gemini 3.6 Flash 似乎比 Gemini 3.1 Pro Preview 运行更快、成本更低,且智能指数更高。这虽是有用的参考信息,但并非谷歌的官方结果,且仍无法替代基于相同提示词的测试。.

Gemini 3.6 Flash 和 Gemini 3.1 Pro 预览版的人工智能分析亮点。.
人工分析模型对比表。此截图支持下方的第三方智能指数、混合价格、输出速度、首次生成代币所需时间以及上下文窗口值。.
资料来源公制Gemini 3.6 Flash双子座 3.1 预览版使用方法
谷歌官方DeepSWE49%在关于 3.6 Flash 发布的帖子中,并未直接与 3.1 Pro 进行对比官方声明主要将3.6版Flash与3.5版Flash进行了对比
谷歌官方MLE 长凳63.9%在关于 3.6 Flash 发布的帖子中,并未直接与 3.1 Pro 进行对比适用于编码/代理模型的预期,并非最终证明
谷歌官方OSWorld-Verified83.0%在关于 3.6 Flash 发布的帖子中,并未直接与 3.1 Pro 进行对比适用于计算机使用场景
人工分析智力指数5046第三方基准测试背景
人工分析输出速度280 个代币/秒119 个代币/秒第三方速度上下文
人工分析获得第一个代币所需的时间11.71秒33.44秒第三方延迟上下文
人工分析综合价格$1.16 / 1M 个代币$1.74 / 1M 代币请勿与官方 API 定价混用

数据图:人工智能分析快照

第三方对比数据采集于2026年7月22日。请将此作为参考依据,而非谷歌的官方声明。.

智力指数:3.6 Flash
50
智能指数:3.1 Pro
46
输出速度:3.6 Flash
280 吨/秒
输出速度:3.1 Pro
119 t/s

我们如何对 Gemini 3.6 Flash 与 Gemini 3.1 Pro 进行测试

每次测试中,两个模型均使用相同的提示、相同的输入以及相同的评分标准。我们不会将一个模型给出的正确答案视为该模型在整体上更优的证明。我们的目标更为具体且更具实用价值:展示每个模型在具体任务中的表现。.

我们根据以下类别对每项输出结果进行了评分:

类别我们的考察重点
结果质量这个答案真的能用吗?
操作说明如下该模型是否符合格式、限制和约束条件?
准确性它是否避免了虚构的事实、价格、链接或主张?
推理深度它是否考虑到了权衡和隐含的约束条件?
结构输出内容是否便于浏览和重复使用?
速度端到端响应时间(单位:秒)
费用根据官方 API 输入/输出代币定价估算得出

该测试通过相同的 API 路由,使用完全相同的请求模型 ID 进行: gemini-3.6-flashgemini-3.1-pro-preview. 每项任务的原始输出、令牌使用量、延迟以及官方API成本估算均被记录下来。.

如果编程是你比较这两款机型的主要原因,请将这一结果与 最适合编码的人工智能模型 请以此为参考,而不是仅凭一条错误修复提示就妄下结论。.

方法说明: 这是一项基于相同提示词的 API 工作流测试,并非行业基准测试。延迟指从该工作区开始的本地端到端耗时。成本根据官方数据估算得出。 Gemini API 标准付费层级价格 于2026年7月22日进行检查。该截图任务使用了一张专为此测试生成的合成结账/仪表盘图片。.

如果你仍在为更广泛的工作选择一个默认模型,那么 最佳AI模型指南 这比单独阅读这组Gemini资料要好得多。.

而且,如果你真正要抉择的是 Google 与 OpenAI 之间,而不是 Flash 与 Pro 之间,那么 GPT-5 与 Gemini 2.5 Pro 对比 这比再制作一张仅包含Gemini数据的基准表要好。.

T01 研究综述

Pro的推荐内容读起来更像是一篇经过精心打磨的SEO团队文案,尽管其中一条矩阵注释错误地标注了来源包。.

专业
T02 代码错误修复

两者都解决了这个问题,但 Flash 在测试中对小数值的断言更为严格。.

闪光灯
T03 长篇文本摘要

Pro 功能更丰富,但 Flash 在预览状态的表述上更简洁、更安全。.

闪光,微弱
T04 数据推理

两者的数学运算都是正确的;Flash 采用了更常见的除法符号,并且结构更简洁,更便于扫描。.

闪光灯
T05 截图分析

Flash 的信息准确无误;Pro 则提供了更详尽的信任度、排版及移动端风险详情。.

优点,轻微
T06 SEO写作/编辑

Flash听起来更自然、更清澈;Pro虽然稳妥,但音色过于夸张。.

闪光灯

Gemini 3.6 Flash 与 Gemini 3.1 Pro 基于相同提示词的生成结果

本节并未将测试数据隐藏在一张综合评分卡中,而是将每个提示分别展示为独立的“Gemini 3.6 Flash 与 Gemini 3.1 Pro”对比卡。 每张对比卡都包含同一提示词的API运行数据,以及实际原始输出结果的简短摘录,因此该对比不仅仅是一张分数表。.

任务结果 / T01

研究综述

获奖作品:Gemini 3.1 Pro 预览版
Gemini 3.6 Flash
得分
4.23
已过去
22.8秒
费用
$0.0471
输出
6,206 个代币
双子座 3.1 预览版
得分
3.76
已过去
48.0秒
费用
$0.0874
输出
7,217 个代币

任务设置: 每位模型必须仅基于受控数据包,撰写一份120至160词的内部采购建议。该数据包包含模型ID、官方API价格、采购方约束条件、未知证据,以及一份严格的四项缺失证据清单。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro Preview 研究合成结果的并排截图。.

实际闪光输出
对于我们由五人组成的 SEO 内容团队,我们建议将 gemini-3.6-flash 设为主要默认模型,并有选择地使用 gemini-3.1-pro-preview。.
Actual Pro 输出
(源包中未包含超过 200k 令牌的提示词定价信息)。.

这说明了什么: Pro 将建议整理成更适合发布的 SEO 风格,并采用了更为克制的推销语气。Flash 对提供的定价层级描述更为精准;而 Pro 的对比表中错误地指出,源文件包中缺少了一项 Flash 的定价细节。.

编辑部评语: “Pro”在这次以写作为主的任务中胜出,因为其建议更接近一份完整的内部SEO简报,但在发布前应修正其定价说明。.

任务结果 / T02

代码错误修复

获奖者:Gemini 3.6 Flash
Gemini 3.6 Flash
得分
4.73
已过去
9.1秒
费用
$0.0166
输出
2,131 个代币
双子座 3.1 预览版
得分
4.51
已过去
13.2秒
费用
$0.0231
输出
1,853 个代币

任务设置: 给定的是一个小型 JavaScript 成本计算器,其中埋藏了两个漏洞:它将“每百万代币”的价格当作“每代币”的价格来处理,并且使用了更高的 Pro 级别的 >=200,000 代币,而不仅仅是20万以上的。.

实际闪光输出
console.assert(Math.abs(actual – expected) < 1e-9, `测试 1 失败:预期值为 ${expected},实际值为 ${actual}`);
Actual Pro 输出
console.assert(test1 === 0.00525, `测试 1 失败:预期值为 0.00525,实际值为 ${test1}`);

这说明了什么: 这两种实现方式都通过一个最小的补丁修复了该模块,但 Flash 编写了基于容差的更安全的浮点数测试,而 Pro 则采用了严格的小数相等性比较。.

编辑部评语: 这两个答案都有效。Flash 更适合投入生产环境,因为它的测试使用了更安全的十进制断言。.

任务结果 / T03

长篇摘要

获胜者:Gemini 3.6 Flash,微弱优势
Gemini 3.6 Flash
得分
4.53
已过去
15.0秒
费用
$0.0455
输出
3,489 个代币
双子座 3.1 预览版
得分
4.2
已过去
28.2秒
费用
$0.0732
输出
3,949 个代币

任务设置: 该提示词使用了一份重复的规划记录,其中包含关于缺失截图、代币成本报告、周五发布压力、模型 ID 安全以及 API 故障处理的后期冲突备注。.

实际闪光输出
如果 Gemini 3.1 Pro 的模型 ID 为"预览版",则确认其不被描述为"稳定版"。.
Actual Pro 输出
已确认 Gemini 3.1 Pro 版本稳定,或者如果 ID 显示为"预览版",则相应内容会进行调整,避免将其称为“稳定版”。.

这说明了什么: Flash 遵循了更稳妥的编辑原则:当 API 模型 ID 显示为“预览”时,不要将 Gemini 3.1 Pro 称为“稳定版”。Pro 版本功能更丰富,但其检查清单中的措辞可能会被解读为优先确认稳定性。.

编辑部评语: Pro 版本呈现出更丰富的质感,而 Flash 版本在预览状态的措辞上则更为简洁且稳妥。.

任务结果 / T04

数据推理

获奖者:Gemini 3.6 Flash
Gemini 3.6 Flash
得分
4.18
已过去
10.5秒
费用
$0.0181
输出
2,368 个代币
双子座 3.1 预览版
得分
4.21
已过去
17.1秒
费用
$0.0276
输出
2,258 个代币

任务设置: 输入数据是一个包含14天渠道数据表,其中包含广告支出、点击量、注册量、付费转化量、收入和页面停留时间。该模型需要对ROAS进行排序,单独处理零广告支出的渠道,对付费转化率进行排序,并推荐下一个$300的预算分配方案。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro Preview 数据推理输出结果的并排截图。.

实际闪光输出
LinkedIn自然流量($45的收入对应$0的支出;按此计算得出的ROAS为未定义/无穷大)。.
Actual Pro 输出
在这里,注册量只是个虚荣指标,因为它并不能保证实际收入。.

这说明了什么: 这两个模型都得出了正确的排名和预算分配结果。Flash 通过使用熟悉的除号代替斜杠符号,使运算结果更易于阅读,而且其编号布局在两次计算中都保持了一致。.

下一步: 对于电子表格式的排名、预算分配和渠道分析,请将此任务与 最适合数据分析的AI工具 指导。.

编辑部评语: Flash 在演示环节赢得了这项任务。Pro 对注册质量给出了有用的解释,但 Flash 的计算格式更便于阅读和核对。.

任务结果 / T05

截图分析

获胜者:Gemini 3.1 Pro 预览版,略胜一筹
Gemini 3.6 Flash
得分
4.68
已过去
11.2秒
费用
$0.0165
输出
1,950 个代币
双子座 3.1 预览版
得分
4.57
已过去
20.7秒
费用
$0.0296
输出
2,261 个代币

任务设置: 输入图像是一张为本次测试专门生成的合成 GLBGPT 结账/仪表盘截图。其中显示了 Pro 版月度结账页面、折扣提示、"立即支付"按钮、订单摘要、税费延迟提示文本以及移动端信任徽章说明。.

用于 T05 截图分析测试的合成 GLBGPT 结账仪表盘截图。.
实际闪光输出
版式稀疏性影响视觉可信度:两个主面板内部过多的空白区域,给人一种粗糙不精致的美感。.
Actual Pro 输出
按钮排版不佳:绿色按钮内的"立即支付"文字比例过小,且使用了纤细的黑色字体。.

这说明了什么: Pro 指出了更多与设计相关的问题,包括按钮排版、价格可信度以及移动端信任标识的放置位置。Flash 的审核结果虽然准确,但不够具体。.

编辑部评语: “Pro”版略胜一筹,因为其分析结果能为设计师提供更具体的改进方案。.

任务结果 / T06

SEO文案撰写/编辑

获奖者:Gemini 3.6 Flash
Gemini 3.6 Flash
得分
4.39
已过去
19.9秒
费用
$0.0366
输出
4,818 个代币
双子座 3.1 预览版
得分
4.11
已过去
34.9秒
费用
$0.0641
输出
5,291 个代币

任务设置: 每位参赛者必须将GLBGPT的对比部分完全重写为纯HTML格式,准确保留受保护的商业声明,包含精确的CTA链接,避免编造测试结果,且字数需控制在180至260词之间。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro:最终评测

Gemini 3.6 Flash 在此次对比中拔得头筹,在六项相同提示的任务中赢得了其中四项。. 其表现最突出的领域包括编码、长文本摘要、数据推理和SEO编辑。Gemini 3.1 Pro Preview 仍能生成更优质的研究综述和更详细的截图审核报告,这表明当任务更注重深度时,Pro 模型能够给出更精炼或更细致的答案。.

在此次受控的API运行中,Flash的表现也更快、成本更低。这一组合使其在此处取得了更优异的整体结果,但并不能完全取代Pro:实际输出结果表明,即使提示词完全相同,模型质量仍会因任务的不同而有所变化。.

为了你自己 Gemini 3.6 Flash 与 Gemini 3.1 Pro 对比 为了进行比较,请将同一条真实提示语分别输入到这两个模型中,在 GLBGPT 并将完成的作品并排进行比较。.

Gemini 3.6 Flash 与 Gemini 3.1 Pro 常见问题解答

Gemini 3.6 Flash 是什么时候发布的?

谷歌 于2026年7月21日发布了Gemini 3.6固件. Gemini API 型号的官方页面列出了 gemini-3.6-flash 作为一种稳定的模型。.

Gemini 3.1 Pro 和 Gemini 3.1 Pro Preview 是同一个版本吗?

有关 API 的定价和技术对比,请参考官方说明 gemini-3.1-pro-preview. 谷歌在2026年2月的发布公告中表示,Gemini 3.1 Pro已以预览版形式发布,旨在在正式发布前对更新进行验证。.

Gemini 3.5 Pro 或 Gemini 3.6 Pro 什么时候发布?

截至2026年7月22日,谷歌已就Gemini 3.5 Pro发表了官方声明,但并未承诺具体的发布日期。在 Gemini 3.6 闪电公告, 谷歌表示,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,并计划“一经准备就绪”便广泛推出该版本。我未找到关于 Gemini 3.6 Pro 的谷歌官方发布日期或官方公告。.

Gemini 3.6 Flash 是否取代了 Gemini 3.1 Pro?

并非官方说法。Gemini 3.6 Flash 是一款注重速度、成本、编码、多模态工作以及主动式执行的稳定版 Flash 模型。Gemini 3.1 Pro Preview 则侧重于更高级的推理和复杂任务。 本文中的同提示测试旨在展示当前实际应用中的差距所在。.

公开基准测试能决定胜负吗?

不。基准测试有助于设定预期,但不能替代在受控条件下使用相同提示进行的测试。本文将官方基准测试声明、第三方基准测试数据以及我们自己的任务级测试结果进行了区分。.

为什么这篇文章使用“Gemini 3.1 Pro Preview”而不是直接写“Gemini 3.1 Pro”?

文章在面向读者的正文中可以使用“Gemini 3.1 Pro”,但在技术表格中应使用 gemini-3.1-pro-preview. 这是 Gemini 型号和定价页面中使用的官方 API 标签。.

Gemini 3.6 Flash 比 Gemini 3.1 Pro Preview 更便宜吗?

是的,这属于标准付费 Gemini API 定价范围。Gemini 3.6 Flash 的定价为:每 100 万个输入令牌 $1.50,每 100 万个输出令牌 $7.50。 Gemini 3.1 Pro Preview 的起始价格为每 100 万个令牌 $2.00(输入)和 $12.00(输出),对于超过 20 万个令牌的提示词,则适用更高档次的定价。.

这两个模型都支持 1M 个令牌的上下文窗口吗?

Gemini API 的官方模型页面显示,这两者的输入令牌数均为 1,048,576 个 gemini-3.6-flashgemini-3.1-pro-preview. 实际上,长上下文测试仍然很重要,因为较大的窗口并不能保证完美的召回率。.

这篇文章应该包含官方截图吗?

是的,但截图应仅用于佐证论点,而非替代整篇文章的内容。主要对比内容应通过易于阅读的表格、数据卡片、价格柱状图、基准测试摘要以及基于相同提示的测试结果表来呈现。.

“同一提示”测试中包含了哪些任务?

此次 API 运行包含六项任务:研究综述、代码错误修复、长文本摘要、数据推理、截图分析以及 SEO 写作/编辑。每次运行都会记录延迟、输入令牌数、输出令牌数、预估成本以及评委评语。.

这篇文章能说 Gemini 3.6 Flash 比 Gemini 3.1 Pro 更好吗?

可以这样说:在这次针对相同提示词的API测试中,Gemini 3.6版本的Flash表现更佳。但不应断言Flash在所有工作负载下都更胜一筹,因为Pro在研究综述和截图分析方面取得了更优异的成绩。.

相同提示的测试是在哪里进行的?

这些测试是通过相同的 API 路由,使用完全相同的模型 ID 执行的 gemini-3.6-flashgemini-3.1-pro-preview. 这不是一项 GLBGPT UI 测试,且本地计时应理解为端到端请求时间,而非提供商侧的延迟。.

既然“Pro”在某些质量类别的评选中获胜,为什么“Gemini 3.6 Flash”却获得了总冠军?

Flash 获胜是因为它在更多任务中给出了更出色的可复用答案。Pro 在研究综述和截图分析方面表现更强,但 Flash 的胜出涵盖了编码、长篇文本摘要、数据推理和 SEO 编辑等任务。.

为什么要在比较中提到GLBGPT?

当读者能够在一个地方测试多个模型时,模型比较就会变得更加容易。GLBGPT在此具有重要意义,因为读者的下一步行动不仅仅是阅读规格说明,而是将同一条提示语应用于不同模型,并比较各模型的输出结果。.

分享帖子:

相关帖子