Gemini 3.7 闪电评测:价格、基准测试和实际测试

gemini 3.7 闪存

型号评测 · 基准测试 · 实际API测试

Gemini 3.7 Flash 被定位为一款适用于编码、智能代理任务、多模态输入及日常创作任务的高速、具备推理能力的模型。更有意义的问题则更具挑战性:当这两个模型收到相同的提示时,它生成的最终作品是否比 Gemini 3.6 Flash 更出色?

本篇关于 Gemini 3.7 Flash 的评测将证据分为三类。谷歌的文档提供了有关模型参数、定价以及官方基准测试声明的支持信息;Artificial Analysis 则提供了独立的第三方基准测试背景信息;而我们的实测对比采用了七项匹配的 API 任务,两款模型均使用了相同的提示词和生成设置。.

Gemini 3.7 Flash 已列入通过 GlobalGPT Gemini 3.7 闪存型号页面. 这样,您就可以在一个地方对多个模型运行同一个提示,包括本评测中使用的基线模型。有关相关背景信息,请参阅我们的 Gemini 3.6 闪评Gemini 3.6 Flash 与 Gemini 3.1 Pro 对比.

证据状态: 六项匹配任务均获得了两个模型给出的完整答案。T01在两个模型均两次达到相同的输出上限后仍无定论,因此该任务结果予以披露但不计分。以下输出片段摘自保存的原始API响应。.
3–2Gemini 3.7 Flash 的已完成任务胜利
1高品质领带
1结果不明确的配对任务
6/7每个模型的可用完成输出

Gemini 3.7 闪评:简短总结

在已完成的六组任务中,有三组任务中,Gemini 3.7 Flash 生成的答案完成度更高, ,而Gemini 3.6 Flash则取得了两胜一平的成绩。其优势体现在编码、数据推理以及符合声明要求的SEO编辑方面。Gemini 3.6 Flash编写了更简洁的前端文本方案,并进行了更细致的状态提取,而在代理规划方面则以平局收场。.

评论快照

度量观测结果是什么意思
输出质量3.7 胜 3 场;3.6 胜 2 场;1 场平局评判依据是每张卡片上展示的完成作品。.
速度混合型3.7 在四项任务中完成得更快,但3.6在六项任务中的平均成绩略低。.
代币效率3.7 使用了 7,948 个输出令牌;3.6 使用了 10,058 个在所有已完成的任务中,3.7 生成的输出令牌比 21% 少。.
3.7的最高成绩安全无风险的SEO编辑它遵循了已确定的事实,没有添加任何缺乏依据的描述。.

这六项是小型、受控的文本任务,并非通用模型排名。T01被排除在外,因为两个模型均未在规定的输出上限内完成要求的答案。.

什么是 Gemini 3.7 Flash?

Gemini 3.7 Flash 是谷歌推出的一款稳定的高吞吐量模型,适用于仍需借助推理能力完成的工作。谷歌列出的输入类型包括文本、图像、视频、音频和 PDF;支持的功能包括函数调用、代码执行、搜索锚定、文件搜索、结构化输出以及计算机使用(预览版)。 实际的问题在于,这些控制措施如何转化为最终成果。.

发布日期与供货情况

截图中显示的“人工分析”页面标明了 Gemini 3.7 Flash(高)版本,其发布时间列为 2026 年 8 月。如需了解权威状态、型号 ID、支持的功能以及发布详情,请使用 Google 的 官方 Gemini 3.7 闪存模型卡 以及相关联的 API 文档。可用性可能因产品、地区、账户和型号层级而异,因此仅凭列出了某款型号的页面,并不能作为该型号普遍可用的证明。.

与 Gemini 3.6 固件相比,有哪些变化?

这一变化不仅仅体现在基准分数的提升上。谷歌将 Gemini 3.7 Flash 描述为 Gemini 3.6 Flash 的迭代版本,其推理基础和可定制化思维均得到了改进。在我们的配对测试中,这体现在三个任务上对约束的处理能力有所增强,但并未包揽所有任务的胜利。.

比较区域Gemini 3.7 FlashGemini 3.6 Flash观察到的证据
代码错误修复正确,测试更简洁没错,但更长一些3.7 小胜
文本前端方案可处理,存在两处编辑错误更简洁,内部一致性更强3.6 微胜
状态感知提取完全回忆起来了,但有一个被夸大的“成功”标签更精确的状态描述3.6 微胜
数据推理没错,默认分隔符更清晰了正确,但需补充更多条件细节3.7 小胜
代理规划强停止门更具体的工具调用细节领带
SEO编辑保留了所有已锁定的索赔添加了一个不受支持的形容词3.7 小胜

Gemini 3.7 Flash 规格与上下文窗口

规格很重要,因为它们界定了进行公平比较的条件。如果您比较的是计划限额而非模型行为,那么我们的 Gemini 限额与配额指南 这是更详细的后续说明。上下文窗口的数值并不意味着模型能准确概括每篇长文档;它仅说明该 API 设计上能够处理的范围。下面的提取测试将分别检验召回率、矛盾处理和未知项的处理情况。.

规格Gemini 3.7 FlashGemini 3.6 Flash资料来源
返回的 API 模型 IDgemini-3.7-flashgemini-3.6-flash记录的 API 响应
输入上下文最多 100 万个代币最多 100 万个代币Google 模型卡片
最大文本输出量64K 个代币64K 个代币Google 模型卡片
记录在案的投入文本、图片、音频、视频文本、图片、音频、视频Google 模型卡片

Gemini 3.7 闪存定价与 API 费用

定价需要明确区分公布费率与单个具体答案的成本。捕获的人工分析摘要显示: 每100万个输入代币为$0.75每100万个输出代币为$3.75 针对所选的 Gemini 3.7 Flash(高)产品条目。这些数据来自第三方页面,不能替代谷歌的官方定价表,也不代表所有接入路径的情况。.

捕获的第三方价格上下文

输入 · $0.75
输出 · $3.75

仅供参考。这些条形图不能替代官方计费单位、计费层级、地区或缓存/批处理规则。.

"(《世界人权宣言》) Google 模型卡片 列出了API的入门费率为 每100万个输入代币为$0.75,每100万个输出代币为$3.75 适用于两款 Flash 机型,有效期至 2026 年 12 月 31 日。下文中的每张卡估算值是将该费率应用于已记录的代币;其中不包括重试、缓存、税费以及特定路由费用。.

成本项目Gemini 3.7 FlashGemini 3.6 Flash证据边界
初始输入价格$0.75 / 1M$0.75 / 1MGoogle 模型卡;有效期至 2026 年 12 月 31 日
初始出厂价$3.75 / 1M$3.75 / 1M不同路线的计费方式可能有所不同
六组已完成的测试关于 $0.0303关于 $0.0382源自已记录的令牌;不包括 T01

Gemini 3.7 Flash 官方基准测试

官方基准测试回答了一个狭义的问题:该模型在已发布的评估中,按照该评估的设置表现如何。这些基准测试虽能提供有用的背景信息,但不能替代本评测中基于相同提示词的输出对比。.

编程、智能体和推理基准测试

Google 的型号卡片和官方文档是验证 Google 自身基准测试声明的依据。最终版本将针对每个数值列出相应的指标、日期、机型、对比机型以及测试环境。例如,与旧款机型相比获得的 3.7 这一结果,不会被悄然表述为“3.7 对比 3.6”。.

Gemini 3.7 Flash 的人工分析基准测试面板
从以下来源获取的独立基准测试背景: 人工分析. 这张截图并非谷歌的官方基准测试表。.

基准测试的收益无法证明什么

  • 更高的编码评分并不意味着每个仓库的第一个补丁都更干净。.
  • 推理分数并不能证明某人在SEO编辑或截图解读方面更胜一筹。.
  • 第三方智力指数不能替代本综述中针对具体任务的证据。.
  • 不应将重叠的不确定性或不同的测试设置作为决定性的排名依据。.
Gemini 3.7 Flash 的人工分析摘要面板
Artificial Analysis 报告显示,智能水平为 56,输出速度为每秒 389.5 个令牌,显示的价格为每 100 万个令牌输入 $0.75,输出 $3.75,并列出了所选 Gemini 3.7 Flash (高)条目提供了一个1M上下文列表。以上均为第三方观察结果。.

我们如何测试 Gemini 3.7 Flash

这是一次匹配的API测试,而非一组互不相关的演示。 两个模型均采用了相同的提示词、源材料、温度值0、输出令牌上限以及呈现方式。T05是在两个模型的首次尝试均触及较低输出上限后,通过共享的5,000令牌重跑获得的评分。T01在两个模型中均未完成,即使经过相同的重跑也是如此。.

记录字段为什么重要
模型 ID 和返回的模型 ID确认所请求的模型即为作出响应的模型。.
已过去的时间(秒)测量同一路由下的端到端响应时间。.
输入和输出令牌支持提供一份可比的成本估算。.
格式符合性区分正确的答案和仍需在结构上进行整理的答案。.
编辑质量检查正确性、完整性、特异性、呈现方式以及安全性声明。.

带有请求头但无可用输出的请求将被标记为执行问题,且不会被计为质量损失。.

Gemini 3.7 Flash 实际测试结果

每张卡片都显示了实际的任务要求、每条已保存回复的忠实摘录,以及基于最终成果做出的评估结果。耗时为端到端时间。费用采用上述提到的谷歌入门级费率。.

测试 1 — 研究综述

任务输入: 仅使用提供的四项事实,撰写一篇180词的购买建议,内容应包括一项建议、三个理由、两个未知因素以及一个测试计划。.

Gemini 3.7 Flash

33.427秒 · 85个输入令牌 / 4,996个输出令牌 · 估计值 $0.01880简体中文(大陆)

第二次匹配运行在达到5,000个令牌的上限后停止,随后生成了一个可用的180词推荐结果。.

Gemini 3.6 Flash

28.706秒 · 85个输入令牌 / 4,996个输出令牌 · 估算值 $0.01880简体中文(大陆)

它返回了相同的完成令牌计数和相同的 长度 完成原因。.

输出结果显示了什么

这两款模型首先达到了2,400个令牌,随后在5,000个令牌处再次出现了相同的行为。部分文本不被视为质量证据。.

任务结论:无法得出明确结论。. 这是输出预算或配置方面的共同失误,并非胜利。.

测试 2 — 代码错误修复

任务输入: 修复 top_paid(records) 返回三个数值最大的已支付记录,在数值相同时保持输入顺序,保留签名,处理空输入,说明原因,并添加两个测试用例。.

Gemini 3.7 Flash

11.379秒 · 90个输入令牌 / 1,431个输出令牌 · 估计 $0.00543

paid.sort(key=lambda r: r["amount"], reverse=True); return paid[:3]

它确定了升序排序是导致问题的原因,并测试了过滤、排序、并列情况以及空输入。.

Gemini 3.6 Flash

13.984秒 · 90个输入令牌 / 2,273个输出令牌 · 估计值:$0.00859(简体中文(大陆))

paid.sort(key=lambda r: r["amount"], reverse=True); return paid[:3]

它生成了同样正确的补丁,并满足了相同的验收标准,只是响应时间更长。.

输出结果显示了什么

两者都正确地利用了 Python 针对平局情况提供的稳定排序算法。3.7 中的解法更简洁,但最终生成的代码和代码覆盖率是等效的。.

任务结果:Gemini 3.7 Flash,小胜。. 这两个修复方案都正确,但方案 3.7 对验收测试的覆盖更为简洁,且使用的完成标记更少。.

测试 3 — 文本前端实现计划

任务输入: 针对所述的双栏结账页面,制定修复方案,以解决以下问题:多余的空白、层次结构不清晰、"立即支付"标签过小、信任提示可见度低、折扣警告、总金额显示以及移动端页面堆叠问题。. 未提供截图。.

Gemini 3.7 Flash

15.009秒 · 86个输入令牌 / 1,591个输出令牌 · 估计耗时 $0.00603

该方案提出了58/42的网格布局、48–56像素的CTA按钮、附近的信任徽章、琥珀色警告、移动端堆叠布局、焦点状态以及44像素的触摸目标。.

Gemini 3.6 Flash

15.254秒 · 86个输入令牌 / 1,767个输出令牌 · 估计耗时 $0.00669

它呈现了始终如一的 60/40 布局、明确的字体大小、48–52px 的行动号召按钮、有序的右侧栏内容、断点以及无障碍检查。.

输出结果显示了什么

这两处都需要修改。3.7版的答案中写道“点击”可负担性“”,显然是指“可操作性”,还将一个非对称网格称为“对称的”。3.6版需要修改的地方较少。.

任务结果:Gemini 3.6 Flash。. 更简洁的文本前端实现方案。.

测试 4 — 状态感知提取

任务输入: 请用120个词概括关于Orion的九个事实,并附上一张表格,同时保留“已确认”、“计划中”、“待定”、“未知”和“未核实”这几种状态。.

Gemini 3.7 Flash

13.681秒 · 117个输入令牌 / 1,064个输出令牌 · 估计值 $0.00408简体中文(大陆)

报告对图片占比较大的18%项目仍未给出结果,但将82%试点项目的结果描述为“成功”,并将第二个试点项目标记为“已确认/计划中”。”

Gemini 3.6 Flash

9.270秒 · 117个输入令牌 / 1,454个输出令牌 · 估计耗时 $0.00554

该文件中对该试点项目作出了中立描述,称其处理了82%起案件,并将第二个试点项目标注为“已批准(法律程序待定)”。”

输出结果显示了什么

两者均保留了所有重要事实。Gemini 3.6 Flash 对“已批准”、“待定”和“未知”这三种状态的描述更为准确,而 3.7 对首次试飞的描述则略有夸大。.

任务结果:Gemini 3.6 Flash,小胜。. 更高的状态保真度。.

测试 5 — 数据推理

任务输入: 根据四个渠道的广告支出、点击量、付费转化和收入数据,展示相关计算结果,按可衡量ROAS和转化率进行排序,将零广告支出视为不可衡量,并建议采用“$300”的条件分配方案。.

Gemini 3.7 Flash

16.540秒 · 137个输入令牌 / 1,981个输出令牌 · 估计耗时 $0.00753

ROAS:电子邮件 7.00×,搜索 3.00×,社交媒体 2.60×;合作伙伴数据无法衡量。转化量:电子邮件 12.5%,搜索和合作伙伴 10%,社交媒体 5%。该广告提供了三种条件分组。.

Gemini 3.6 Flash

18.096秒 · 137个输入令牌 / 2,403个输出令牌 · 估计耗时 $0.00911

它生成了相同的排名和边界情况处理方案,随后提供了效率、多元化以及“合伙人测试”分配方案。.

输出结果显示了什么

这两种计算方式都是正确的,且都使该建议带有条件性。两者都围绕“Partner”的零支出添加了推测性内容,因此该句需要来源佐证或予以删除。.

任务结果:Gemini 3.7 Flash,小胜。. 这两种计算方式都正确,但3.7提供了更清晰的默认预算分配方案,且所需的完成代币更少。.

测试 6 — 主动规划与工具使用

任务输入: 仅使用四种已命名的工具,制定一份不超过220词的计划。如果页面不可用、非官方或含义模糊,请停止操作,且不要声称已运行这些工具。.

Gemini 3.7 Flash

10.787秒 · 100个输入令牌 / 1,174个输出令牌 · 估计耗时 $0.00448

其四个步骤与提供的工具一一对应,随后依次经过“官方域名”、“可用性”和“清晰度”三个审核环节。完成该流程需要且仅需一条经过验证的CSV记录。.

Gemini 3.6 Flash

9.702秒 · 100个输入令牌 / 1,328个输出令牌 · 估算值 $0.00506简体中文(大陆)

该方案虽然可行,但增加了“或解析 HTML 正文”这一操作,而该操作超出了所提供工具的范围。.

输出结果显示了什么

两者都遵守“官方来源停止规则”,并避免伪装成已执行工具。3.7方案对可用函数的限制更为严格。.

任务结果:平局。. 这两套方案都遵守了官方来源的限制条件,并在未声称工具已运行的情况下停止执行;它们的优势略有不同。.

测试 7 — SEO 写作与编辑

任务输入: 返回的 HTML 内容仅包含一个段落和一个简短列表,精确使用该关键词一次,并保留四个已锁定的事实,切勿杜撰结果、价格、发布日期或可用性声明。.

Gemini 3.7 Flash

7.263秒 · 125个输入令牌 / 707个输出令牌 · 估计 $0.00275

<p>在即将发布的这篇关于 Gemini 3.7 Flash 的评测中,我们将通过对比官方基准测试数据与采用相同提示词的 API 测试结果,对谷歌的该模型进行分析;实际测试结果目前尚未公布。.</p>

它遵循了 HTML 结构,仅使用了一次该关键字,并保留了已锁定的声明。.

Gemini 3.6 Flash

7.542秒 · 125个输入令牌 / 833个输出令牌 · 估计耗时 $0.00322

<p>这篇关于 Gemini 3.7 Flash 的初步评测对谷歌的新机型进行了评估……不过详细的实机测试结果目前尚未公布。.</p>

结构是正确的,但“新模型”提出了一个超出已定事实范围的主张。.

输出结果显示了什么

决定性的区别在于声明安全性:3.7 版本拒绝添加该无支持依据的描述符,同时返回了有效的紧凑 HTML。.

任务结果:Gemini 3.7 Flash。. 更好地遵守“锁定事实”原则。.

Gemini 3.7 闪电测试评分表及要点总结

从最终输出质量来看,Gemini 3.7 Flash 在对比中表现更佳,但这种优势主要源于指令执行的严谨性,而非性能上的显著差距。Gemini 3.6 Flash 在代码和算术运算方面仍具竞争力,且生成的前端计划更优。.

配对测试成绩单

度量Gemini 3.7 FlashGemini 3.6 Flash
任务胜利32
优质领带11
结果不明确的任务11
可用的已完成任务第 6 页,共 7 页第 6 页,共 7 页
已完成任务的输出令牌7,94810,058
最佳观测结果有界能动计划文本前端方案

Gemini 3.7 闪存限制

观察到的最大局限性是相同的:在处理一项仅包含180个单词的简单研究综述请求时,这两个模型都耗尽了全部输出配额两次。在测试配置下,T01无法使用。.

Gemini 3.7 Flash 的表现并非全面优异。其前端方案中存在措辞错误,且内部布局与描述不符;而两个数据答案均围绕零消耗通道引入了推测性上下文。 该包仅使用了文本输入,因此无法评估图像、音频、视频或真正长上下文的质量。.

Gemini 3.7 Flash 值得购买吗?

是的,当需要严格遵守指令时,Gemini 3.7 Flash 确实值得测试。. 它在六个可用的任务对中赢得了三项已完成的任务,且总输出令牌数更少。但在简单的代码修复、算术运算或界面规划方面,其表现则不那么突出——在这些任务中,Gemini 3.6 Flash 要么赢得了前端任务,要么表现得非常接近。.

您可以在以下位置运行相同的命令提示符: GlobalGPT 并将其与同一工作区中的 Gemini 3.6 Flash 进行比较。请将您的定期任务作为决定性测试。.

Gemini 3.7 闪评:最终评价

这篇关于 Gemini 3.7 Flash 的评测以一个虽有争议但站得住脚的结论收尾: Gemini 3.7 Flash 赢得了三项已完成的任务,Gemini 3.6 Flash 赢得了两项,还有一项打成平手。. 有一项研究任务未能得出明确结论,因为两个模型都两次达到了共同的输出上限。.

Gemini 3.6 Flash 并未过时。它生成了更优秀的文本前端方案和更严谨的状态表,而 3.7 在编码、数据推理以及基于锁定事实的 SEO 编辑方面表现更强。在代理规划任务上两者不分伯仲,因此此次升级是选择性的,而非绝对的。.

Gemini 3.7 闪存常见问题解答

Gemini 3.7 固件是什么时候发布的?

谷歌将 Gemini 3.7 Flash 列为稳定型号,该型号的文档最后更新于 2026 年 8 月 13 日。.

Gemini 3.7 Flash 版本是稳定版还是预览版?

在 Google 的 Gemini API 模型文档中,该功能被标记为“稳定”。但 AI Studio、Gemini 消费级产品以及第三方接口仍可能显示不同的可用性或配额。.

Gemini 3.7 Flash API 的型号 ID 是什么?

所请求的比较使用了 `gemini-3.7-flash`,但在最终文章将其标记为“已验证”之前,必须先从 API 响应中记录下返回的模型 ID。.

Gemini 3.7 Flash 的价格是多少?

截至2026年12月31日,谷歌付费层级的费率为:每100万个输入令牌$0.75,每100万个输出令牌$3.75; 自2027年1月1日起,列出的费率将调整为$1.50/$7.50。.

Gemini 3.7 Flash 是否免费?

面向消费者或第三方的可用性并不意味着可以无限制地免费访问 API。请查看您计划使用的访问方式对应的接口、配额、速率限制和计费条款。.

什么是 Gemini 3.7 Flash 上下文窗口?

截图中显示的“人工分析”摘要包含一个100万个令牌的上下文列表。请查阅谷歌的文档,确认确切的官方上下文限制,以及针对长上下文的定价或功能限制。.

Gemini 3.7 Flash 是否支持图片、音频、视频和 PDF 文件?

请核实具体 API 模型 ID 所支持的输入类型。在评审过程中,每种受支持的输入模式将被视为文档中记载的功能,而非证明所有输入类型质量均等。.

什么是 Gemini 3.7 闪存思考层级?

Gemini 3.7 Flash 配备了可配置的智能控制功能。具体级别、默认值、代币行为以及计费影响应参考官方 API 文档。.

Gemini 3.7 Flash 比 Gemini 3.6 Flash 更好吗?

在这项匹配的API测试中,Gemini 3.7 Flash在三项完成的任务中胜出,Gemini 3.6 Flash在两项中胜出,一项打平,另一项结果不明确。这表明3.7版本仅具有微弱优势,而非全面胜出。.

Gemini 3.7 Flash 比 Gemini 3.1 Pro 更好吗?

本草案并未作出此类主张。Gemini 3.1 Pro 是一个不同的对比基准,因此需要其专属的匹配提示集和证据,而非基于 Gemini 3.6 Flash 对比结果的推断。.

Gemini 3.7 Flash 适合编程吗?

是的,在本文测试的这一狭义的错误修复任务中,两种模型都生成了正确的最小补丁,但 Gemini 3.7 Flash 因测试覆盖率更干净且完成标记更少,略胜一筹。.

Gemini 3.7 Flash 能否使用工具并运行代理工作流?

请查阅官方工具和函数调用文档以了解确切的执行路径。本评测中的代理测试旨在评估规划能力和边界感知能力;它并不主张仅凭一个计划就能证明工具执行成功。.

在哪里可以获取 Gemini 3.7 固件?

如有提供,请使用谷歌的官方接入点;否则,请尝试 GlobalGPT 型号页面 当该模型在您的账户和所在地区启用时。.

官方基准测试结果与实际使用情况一致吗?

并非自动如此。官方基准测试和第三方评估提供了有用的背景信息,而相同提示词测试则展示了模型如何处理正在被测量的特定任务。本评测将这些证据类型区分开来。.

分享帖子:

相关帖子