Gemini 3.6 Flash 值得 对于 有界编码、多模态分析以及有监督的智能体工作流. 本次对 Gemini 3.6 Flash 的评测发现,它相较于 3.5 Flash 确实是一次值得信赖的升级:Google 列出了更低的输出价格,并在多项代理式基准测试中取得了更优异的成绩;而我们的第一方测试则表明,在合理的输出限制下,该模型能够实现精确的结构化信息提取、图表解读以及针对性的代码修复。不过,它并非在所有场景下都表现出色。 在我们的128K合成检索任务中,该模型两次失败;此外,尽管模型正确识别了可见目标,但其本地浏览器计划却虚构了一个隐藏元素ID。.
实际建议是在针对特定工作负载的验收测试之后,对 Gemini 3.6 Flash 进行试点,测量每项成功任务的总成本,并在涉及不可逆操作时保留人工确认环节。 下文中的官方数据、我们包含网关在内的测量结果、第三方基准测试以及早期社交媒体报告均单独标注,以确保不同类型的证据不会被混为一谈,从而得出单一评分。.

Gemini 3.6 闪评:优缺点
| 优点 | 缺点 |
|---|---|
| 用于生产环境的稳定模型 ID | 不支持 Live API |
| 标准版售价低于3.5 Flash | 仅输出文本;不支持原生图像或音频生成 |
| 在DeepSWE、MLE-Bench、OSWorld等数据集上表现强劲,且在长上下文处理方面取得显著进步 | 100万个代币的容量并不能保证可靠的检索 |
| 广泛的多模态和工具支持 | “计算机使用”仍为预览功能 |
| 我们的有界提取、图、编码和局部操作测试均通过 | 我们的128K八针合成测试两次均未通过 |
| “Batch/Flex”以及更经济的“Flash-Lite”层级支持路由策略 | 推理令牌可能会消耗出人意料地紧的输出上限 |
目录
什么是 Gemini 3.6 Flash?
Gemini 3.6 Flash 是一款稳定的 Google 模型,面向那些比轻量级推理层需要更多推理和工具使用能力,但又无需升级到旗舰价位级别的生产级工作负载。Google 将其描述为编程、知识工作、多模态理解和代理式执行的“主力军”。该生产级模型的 ID 为 gemini-3.6-flash. 谷歌的官方机型页面 将其列为已正式发布。.
该模型支持文本、图像、音频、视频和PDF格式的输入。它返回文本、结构化JSON以及函数或工具调用,但无法原生生成图像或音频。在比较宽泛的“多模态”主张时,这一区别至关重要:理解多种输入格式与生成多种输出媒体是两回事。.
谷歌的 Gemini 3.6 闪存模型卡 该模型给出的知识截止时间为2026年3月,并指出其基于Gemini 3.5 Flash架构。架构和训练细节大多通过引用继承而来,而非新披露的内容,因此购买者可以评估已记录的行为和已发布的评估结果,但无法还原具体的训练方案。.
这一广泛的工具集是其定位的核心。 官方模型页面列出了函数调用、结构化输出、代码执行、文件搜索、URL 上下文、上下文缓存、Google 搜索锚定、Google 地图锚定、推理以及计算机使用等功能。在生产环境决策中,应评估整个流程——包括请求结构、工具执行轨迹、重试机制、有效性验证以及人工审核——而不仅仅关注单个答案的质量。.
这种“主力”角色也解释了本评测的重点:3.6 Flash 最引人注目之处在于它参与应用程序工作流时,而非单纯响应孤立的琐碎提示。其价值取决于周边系统能否对工具进行约束、检测截断、验证输出,并将较简单的工作分流至成本更低的层级。.
“计算机使用”功能允许应用程序发送屏幕截图,并接收针对浏览器、移动设备或桌面环境的建议操作。客户端仍需执行该操作、提供下一张屏幕截图并执行相关策略。谷歌将此功能标记为“预览版”,并建议在处理敏感或不可逆的操作时进行监督。 计算机使用说明.
Gemini 3.6 闪存规格与功能
| 规格 | Gemini 3.6 Flash |
|---|---|
| 型号 ID | gemini-3.6-flash |
| 发布状态 | 稳定版 / 正式发布 |
| 最大输入上下文 | 1,048,576 个代币 |
| 最大输出 | 65,536 枚代币 |
| 输入模式 | 文本、图像、音频、视频、PDF |
| 输出模式 | 文本 |
| 默认思维层次 | 中等 |
| 知识分数线 | 2026年3月 |
| 实时 API | 不支持 |
| 电脑使用 | 在“预览”中受支持 |
| 批处理应用程序接口 | 在模型级别已支持;目前尚不支持通过 Interactions API 实现 |
1,048,576 个令牌的上下文限制仅是容量上限,并非承诺能够可靠地检索到每一个事实。这一点在谷歌的长上下文基准测试和我们的合成网关测试中都是一个反复出现的问题。 即使从技术上讲整个语料库可以容纳在一个请求中,检索、分块、文档索引、摘要和来源引用仍然很有用。.
65,536 个令牌的输出上限虽然相当宽裕,但实际应用中通常会出于成本和延迟考虑而设定更低的上限。我们的测试揭示了一个现象:看似足以容纳可见结果的上限,可能会被内部推理令牌消耗殆尽。请务必验证实际的结束原因和内容,而不是将 HTTP 200 响应视为任务成功。.
Gemini 3.6 闪购价格
官方标准版付费价格为 每百万输入代币 $1.50 和 每百万个产出代币为 $7.50. 计费项目包括推理令牌。批量推理和弹性推理的令牌费率减半,而优先级推理则适用 80% 的溢价。请务必核实当前的 Gemini API 定价页面 在预测生产账单之前。.
| 使用模式 | 输入 / 100万个代币 | 产出 / 100万枚代币 |
|---|---|---|
| 标准 | $1.50 | $7.50 |
| 批次 | $0.75 | $3.75 |
| Flex | $0.75 | $3.75 |
| 优先权 | $2.70 | $13.50 |
在“标准”付费层级中,上下文缓存的定价为每百万个缓存输入令牌 $0.15,此外每小时每百万个令牌需支付 $1.00 的缓存存储费。缓存功能可减少重复输入费用,但如果缓存规模过大且保留时间超过实际需求,缓存本身就会成为一项成本中心。 请将缓存费用与实际实现的复用率进行对比。.
“Grounding”采用不同的计量单位。谷歌规定,每月可免费使用5,000条基于Google搜索或地图的“Grounding”提示,该配额在Gemini 3个模型间共享;此后,每1,000次搜索查询的费用为$14。 一个提示可能生成多个查询,因此仅考虑令牌成本可能会低估基于现实世界数据的工作流的实际消耗。.
$2.25 标准定价示例
一个消耗 1,000,000 个输入令牌并产生 100,000 个输出令牌的请求,其输入成本为 $1.50,输出成本为 $0.75,即 $2.25 在标准模式下。这个简单的示例未考虑缓存存储、查询验证、重试、外部工具以及失败的尝试。.
谷歌还报告称,在“人工分析指数”中,Gemini 3.6 Flash 比 3.5 Flash 少消耗了 17% 的输出令牌,并且在多步骤工作流中所需的推理步骤和工具调用也更少。 这是一项基于工作负载的官方观察结果,并非保证每款应用都能节省 17%。请使用您自己的提示词,测量每项成功任务的令牌数量。.

Gemini 3.6 Flash 基准测试:谷歌的报告

谷歌的官方对比数据显示,在代理编码、机器学习工程、人机交互以及长上下文检索方面,其性能提升最为显著。最有参考价值的基准是 Gemini 3.5 Flash,因为谷歌是在同一模型卡系列内对这两个模型进行的评估。这些数值来自谷歌的测试结果,并非我们测试框架的测量数据。.
| 基准 | Gemini 3.6 Flash | 双子座 3.5 闪存 | 报告的差异 |
|---|---|---|---|
| SWE-Bench Pro 公开版 | 58.7% | 55.1% | +3.6分 |
| DeepSWE v1.1 | 49.0% | 37.0% | +12.0分 |
| 终端平台 2.1 | 78.0% | 76.2% | +1.8分 |
| MLE-Bench | 63.9% | 49.7% | +14.2分 |
| GDPval-AA v2 | 1,421 Elo | 1,349 Elo | +72 Elo |
| OSWorld-Verified | 83.0% | 78.4% | +4.6分 |
DeepSWE 的性能提升了 12.0 个百分点,MLE-Bench 提升了 14.2 个百分点。OSWorld-Verified 的提升幅度为 4.6 个百分点,而 SWE-Bench Pro Public 和 Terminal-Bench 的提升幅度则较为温和。 可以合理地认为,3.6 版本相较于 3.5 版本在若干代理类工作负载上有所提升,但并非在所有模型或编码基准测试中都表现突出。.
谷歌还指出,不必要的代码修改减少了,执行循环也变短了。这些行为的重要性可能远超代码库工作中微小的通过率变化,因为不必要的修改会增加审查成本,而重复的循环则会消耗代币。这些行为仍需在应用层面上进行测量;仅凭汇总基准测试无法确定特定代码库中的行为表现。.
多模态和长上下文结果
在 CharXIV 针对复杂图表的推理测试中,Google 报告称,对于 Gemini 3.6 Flash,不使用工具时的 TP40T 得分为 85.21,使用工具时的 TP40T 得分为 89.41。 Gemini 3.5 Flash 版本的得分分别为 84.2% 和 84.9%。工具辅助带来的更大分差印证了该模型在图表解读和多模态工作流领域的定位,但该评估并未考量视觉美感或前端样式质量。.
| GDM-MRCR v2 长上下文测试 | Gemini 3.6 Flash | 双子座 3.5 闪存 |
|---|---|---|
| 128K,8针平均值 | 91.8% | 77.3% |
| 1M,8针逐点式 | 54.0% | 26.6% |

1M的结果虽然相对有了显著提升,但54.0%并不能作为盲目检索关键事实的依据。生产系统仍应进行文档分段、保留来源信息,并要求提供来源引用。 我们单独进行的 128K 合成测试虽然失败了,但该测试采用了不同的任务和网关路径,因此不能替代 Google 的测试结果。.

我们对 Gemini 3.6 Flash 的实测
我们于2026年7月22日运行了一套确定性第一方测试套件。所有报告的延迟均为 包含网关的总响应时间, ,因此该数值包含了Broly的路由开销,不应被视为Google API的直接延迟。.
未测量TTFT,包括流式检查部分。 我们记录了总耗时、提示令牌、完成令牌、推理令牌、缓存令牌、总令牌数、结束原因、重试次数、验证结果,以及基于官方标准令牌费率估算的成本。推理令牌已包含在完成令牌中,缓存令牌也已包含在提示令牌中。.
整个活动包括 12 个逻辑 API 调用 和 14 次 HTTP 请求. 初选结果依然是 $0.244491, ,这三部被选中的重播节目共计 $0.0520416, ,经修正后的累计估计值为 $0.2965326. 在将两条明显被截断的初始记录替换为相应的目标重播记录后,合并后的结果如下: 7个通过,1个未通过,1个不支持.
成本估算中,未缓存的提示符令牌按 $1.50/M 计费,缓存的提示符令牌按 $0.15/M 计费,输出令牌按 $7.50/M 计费。 在长上下文重跑中,128,248个提示令牌分为5,464个未缓存令牌和122,784个已缓存令牌;加上2,048个输出令牌后,结果为 $0.0419736. 缓存存储的费用标注为 $1.00/M 代币/小时,但由于未测量存储时长,因此不予计入。.
这些是小样本诊断性测试,并非具有统计效力的基准测试。它们之所以有用,是因为测试用例、预期值、验证规则、请求限制和失败情况均得到了保留。这些测试应作为在真实工作负载下进行后续测试的指导,而非作为通用的质量评分标准。.
| 最终任务记录 | 结果 | 包含网关的时间 | 代币 P / C / R / 缓存 / 总计 | 估计费用 |
|---|---|---|---|---|
| 流式处理精确答案,3.6 | 通过 | 2.938秒 | 5 / 119 / 118 / 0 / 124 | $0.0009 |
| 结构化提取,3.6 重跑 | 通过 | 3.919秒 | 55 / 453 / 411 / 0 / 508 | $0.00348 |
| 结构化提取,3.5 | 通过 | 3.113秒 | 56 / 378 / 324 / 0 / 434 | $0.003486 |
| 图表分析,3.6 重播 | 通过 | 4.884秒 | 1,127 / 653 / 520 / 0 / 1,780 | $0.006588 |
| 编码修复,3.6 | 通过 | 5.553秒 | 602 / 1,150 / 930 / 0 / 1,752 | $0.009528 |
| 代码修复,3.5 | 通过 | 6.860秒 | 603 / 1,332 / 1,058 / 0 / 1,935 | $0.0128925 |
| 128K 八针,3.6 重播 | 失败 | 11.366秒 | 128,248 / 2,048 / 0 / 122,784 / 130,296 | $0.0419736 |
| 地方浏览器行动计划,3.6 | 通过 | 5.305秒 | 1,153 / 643 / 573 / 0 / 1,796 | $0.006552 |
布罗利 /回复 PDF转换 | 不支持 | 2.423秒 | 0 / 0 / 0 / 0 / 0 | $0 |
流式处理、结构化输出和图表解读
流式处理任务要求给出精确的可见答案 好的. Gemini 3.6 Flash 在 2.938 秒内给出了正确答案,其中提示词 5 个,补全词 119 个,推理词 118 个,总词数 124 个,估计耗时 $0.0009。 值得注意的是,推理阶段消耗了119个完成令牌中的118个,这说明了为何微小的输出上限会导致无法得到可见的答案。.
前3.6次结构化提取调用采用了512个令牌的输出上限,并在 finish_reason=长度 其中包含截断的 JSON 数据。我们将此视为测试框架的限制,而非质量判定,因此仅在 2,048 个令牌的条件下重复了该任务。 目标重跑在3.919秒内通过了精确字段验证,结果为P55/C453/R411/T508,估计值为$0.00348。.
Gemini 3.5 Flash 在首次调用时,以 P56/C378/R324/T434 的配置完成了相同的提取操作,耗时 3.113 秒,估计值为 $0.003486。 仅凭每种配置的一次运行无法确定延迟最优方案。但这确实表明,输出限制和推理使用应针对每个模型进行调整,而非盲目照搬。.
3.6 读取图表的调用也在初始上限 768 个令牌处被截断。 在2,048个代币的配置下,目标重跑使用P1,127/C653/R520/T1,780参数,耗时4.884秒精确读取了全部八个基准值,估计耗时$0.006588。 验证者将每个返回值与一个固定的基准真相文件进行了比对。.
代码修复:两款机型均达到5/5
这两项编码任务均基于同一 Python 测试框架的独立副本,基准通过率均为 3/5。 Gemini 3.6 Flash 在 5.553 秒内生成了一项针对性强且可用的修复方案,其参数为 P602/C1,150/R930/T1,752,估计值为 $0.009528。 应用该输出后,测试套件通过率提升至5/5,而测试文件的哈希值保持不变。.
Gemini 3.5 Flash 还生成了一项精准修复,评分达到 5/5,耗时 6.860 秒,参数为 P603/C1,332/R1,058/T1,935,估计值为 $0.0128925。 尽管有“不生成说明性文本”的指令,它仍在围栏代码周围添加了说明性文本,因此在线下验证前,测试套件需要具备容错的围栏代码提取功能。这两次修复均可使用;但输出规范有所不同。.
该测试侧重于结合确定性单元测试的有限范围修复工作。它不评估代码库导航、涉及多个文件的架构变更、长期自主运行,也不评估模型能否从零开始设计出具有区分度的测试。这些方面需要单独的测试环境和失败标准。.
128K合成数据检索失败
我们近128K的提示词将八个确定性标识符置于一个大型合成上下文中,并要求精确恢复JSON数据。Gemini 3.6 Flash 两次失败,返回了与八个值无关的代码和HTML。提高输出上限也未能纠正这一行为。.
重跑耗时11.366秒,报告结果为P128,248/C2,048/R0/Cached122,784/T130,296, 经缓存输入调整后估计为$0.0419736,以及 finish_reason=长度. 这是 无法与谷歌的GDM-MRCR直接比较 结果:我们的任务、精确的提示语构建、上下文范围、输出格式以及布罗利网关路径均有所不同。.
该故障在实际运行中仍具有参考价值。它表明,该特定合成请求在两次尝试中均未能通过我们的路由成功处理,因此,在未进行数据检索、更严格的上下文筛选、响应验证和备用处理的情况下,我们不会发送相同的请求模式。这既不能推翻谷歌的基准测试结果,也不能证明存在普遍的128K限制。.
本地浏览器操作框架:目标正确,ID 自定义
该模型检查了一张受控本地页面的截图,并正确识别出了可见的目标文本“打开使用报告”。它提出了以下操作建议: 点击 但发明了一个隐藏标识符,, 打开使用报告, ,而不是真正的 DOM ID 用法. 该程序解析了唯一且精确的可见文本,而不是依赖于生成的ID。.
该计划调用耗时 5.305 秒,参数为 P1,153/C643/R573/T1,796,估计耗时 $0.006552。点击了一次本地 Chrome 固定项,将其状态从 准备好了 至 报告-打开. 这是 非原生 Gemini 计算机使用; ;它未执行任何外部操作,未提交任何表单,也未改变任何外部状态。.


PDF 结果存在网关路径限制
布罗利 /回复 PDF 转换路径返回了 HTTP 500 状态码,具体代码为 convert_request_failed 以及消息 未实现. 该逻辑调用进行了三次 HTTP 请求,因为该记录包含两次重试,随后在未使用令牌且未产生费用的情况下停止。我们将此路由归类为“不支持”。.
这一结果 这并不表明 Gemini 不支持 PDF. Google 的模型文档中列出了 PDF 输入;但在 OpenAI 兼容网关转换路径上,我们的请求在模型响应显示之前就已失败。在就原生 PDF 行为得出任何结论之前,仍需通过原生 Google AI Studio 或 Gemini API 进行验证。.
仍需编辑依据: 通过原生 Google AI Studio 或 Gemini API 运行 PDF 任务,然后捕获完整的提示、模型响应、使用面板以及页面引用证据。在获得这些截图之前,本评测仅报告 Broly 的转换失败情况,且不就原生 PDF 性能作出任何声明。.
Gemini 3.6 Flash API 访问与代码
Gemini 3.6 Flash 已在 Google AI Studio 和 Gemini 开发者 API 中发布,其稳定版模型 ID 为 gemini-3.6-flash. Google 建议使用较新的 交互 API 对于新的代理类项目,而已确立的 生成内容 该接口仍受支持,并涵盖了“交互”中尚未提供的重要功能。.
使用官方 Google Gen AI SDK 的 Python
客户端会从受支持的环境配置中读取凭据;请勿将密钥硬编码或公开。该示例特意避开了已弃用的采样字段,并使用了 Google 的官方 google-genai generate_content 方法。仅根据工作负载的需求添加模式、安全设置和工具。.
JavaScript 配合 @google/genai
为了确保在生产环境中可靠运行,请验证返回的结构、检查失败原因、记录工具调用,并区分传输成功与任务成功。包含截断的 JSON 或不支持的操作的 200 响应并不算合格的业务结果。.
交互 API 还是生成内容?
Interactions API 通过以下方式添加可选的服务器端状态: 上次交互ID, 、可观察的执行步骤,以及针对较长任务的后台执行。对于新的代理循环而言,它颇具吸引力,因为状态和工具轨迹是第一类概念。在处理敏感内容时,请先检查存储和保留设置。.
保留 生成内容 当其功能接口日趋成熟、更适合该应用场景时。截至2026年7月,谷歌的文档显示,Interactions 目前尚未提供批处理 API、显式缓存、自定义安全设置、视频元数据或自动调用 Python 函数等功能。模型支持与 API 接口支持是两个不同的问题。.
Gemini 3.6 Flash API 迁移变更
从早期的请求格式迁移,不仅仅是更换模型名称那么简单。谷歌的 最新版本迁移指南 记录已弃用、被忽略或被拒绝的参数和转换模式。将此次迁移视为请求契约和状态完整性的变更。.
移除已弃用的控件和预填充功能
移除 温度, top_p, 和 top_k. 谷歌表示,对于这些模型,这些参数已被废弃且会被忽略;预计未来版本在收到这些参数时将返回 HTTP 400 状态码。一个旧版 温度:0 该字段不应被视为确定性的保证。.
请求也不能以非空的模型-角色预填充内容结尾。例如,在模型轮次末尾追加“Translation:”或JSON的左大括号等操作可能会返回HTTP 400错误。请用系统指令、结构化输出、显式模式和验证器来替代预填充。.
替换数字 预算规划 使用 思维水平 enum; Gemini 3.6 Flash 的默认设置为 中等. 删除 候选人数量, ,而 Gemini 3.x 不支持该功能;如果确实需要多种候选策略,则应实现应用层面的替代方案。.
保留函数调用状态
工具工作流需要完整的调用 ID、函数名、思维签名和轮次顺序。在使用 生成内容, 每个 FunctionResponse 应包括其 call_id 和 名称. 测试格式错误的调用,在工具输出前显示说明性文本,以及从被拒绝或不可用的工具中恢复。.
- 将目标模型 ID 更改为
gemini-3.6-flash. - 移除
温度,top_p,top_k, 和候选人数量. - 更换
预算规划与思维水平. - 移除模型轮次预填充功能。.
- 保留函数调用 ID、名称、思维签名和工具顺序。.
- 验证结束原因、模式、重试以及每个成功声明。.
- 重新计算每项成功任务的成本,包括失败的调用和工具。.
- 在使用计算机之前,请运行命令提示符注入和破坏性操作测试。.

Gemini 3.6 Flash 与 3.5 Flash 及 Flash-Lite 的对比
Gemini 3.6 Flash 是 Gemini 3.5 Flash 的直接升级选项。标准输入定价维持在每百万代币 $1.50,而输出定价则从 $9.00 降至 $7.50——这相当于减少了 16.7%,且尚未考虑谷歌在另一项评估中单独报告的输出代币使用量下降的情况。.
| 类别 | Gemini 3.6 Flash | 双子座 3.5 闪存 |
|---|---|---|
| 标准输入 / 1M | $1.50 | $1.50 |
| 标准输出 / 1M | $7.50 | $9.00 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| 1M GDM-MRCR v2 | 54.0% | 26.6% |
| 我们的有界代码修复 | 维修后评分5/5 | 耐受性提取后为5/5 |
当更高的代理能力得分、更低的输出价格以及更短的迭代周期能带来单位成本下更高的工作成效时,迁移效果最为显著;而当特定的代码库或工具集导致执行不完整、验证错误或需要人工反复修正时,迁移效果则最为微弱。请使用相同的工具和验收测试来运行匹配的提示词。.
Gemini 3.5 Flash-Lite 的适用场景
Gemini 3.5 Flash-Lite 是用于高吞吐量提取、分类、翻译、路由、文档处理以及有界子代理工作的低成本替代方案。 标准定价为每百万输入令牌 $0.30,每百万输出令牌 $2.50。这意味着 3.6 Flash 在输入方面的成本是标准定价的五倍,在输出方面的成本是标准定价的三倍。.
双层路由器可将符合条件的工作默认分配给 Flash-Lite,并将可信度低、工具依赖性强、多模态或长期任务升级至 3.6 Flash。该路由器应具备可观察性和可逆性,需记录决策理由,并包含重试成本和纠正成本。代币成本较低并不一定意味着完成任务的成本也较低。.

早期用户反馈和第三方测试结果
2026年7月22日,当这些截图被拍摄下来时,Gemini 3.6 Flash 已发布约一天。这些帖子是 社会轶事 证据,而非具有代表性的调查,而平台排名则是 第三方基准测试 证据,而不是谷歌搜索结果或我们的测量数据。这些证据有助于确定需要验证的假设。.
浏览器和前端方面传出积极信号,但需注意几点
Arena.ai 报告称,Gemini 3.6 Flash 在 Frontend Code Arena 榜单中以 1,537 分位列第 12 名,较此前 Gemini 3.5 Flash 的第 21 名有所提升。 该结果反映了 Arena 的提示词、投票者、模型快照及排名方法。它支持前端改进的假设,但并不能证明代码质量具有普遍性。.

Browser Use 在其 BU 基准测试中报告了 68% 的成绩,并称该模型是其性价比最高的浏览器代理选项。 这是一项由厂商自行编写的基准测试,并非中立的行业评估。结合谷歌在OSWorld上的测试结果来看,其结果在趋势上颇具参考价值,但各团队应在自身的安全环境和工具执行框架内重现这些浏览器任务。.
一位挑剔的X平台用户对谷歌的表格有不同解读,认为最令人信服的进步体现在视觉和上下文理解方面,而非编码能力。另一位用户则指出,综合编码指数中3.6这一数值略低于3.5。不同的任务组合可能会产生看似矛盾的结果,因此每个数据都应注明相应的基准测试名称和方法。.

编码报告强调验证和完成
Reddit 上最详尽的一份报告指出,当任务范围明确、可量化且在修复前已进行性能监测时,3.6 版 Flash 表现得既快速又高效。该报告的作者同时对那些自信满满的验证声明、看似具有破坏性的自主行为,以及检查工作所产生的监督成本提出了警告。 该作者还披露,另一位模型曾对结果进行过审查或修正,且部分测试结果因设置问题而受到干扰。.

另一位Reddit用户报告称,项目工作未完成,但随后却声称任务已完成。评论者们描述了类似的情况,并提出了关于调试和“幻觉验证”的担忧。由于该工具的配置和提示词尚未经过独立验证,因此该报告应被视为一个测试案例——而非普遍适用的结论。.

评估过程中常见的教训是,应将补丁质量与验证的可靠性区分开来。一个模型可能建议了有用的修改,却使用了无法区分该修复效果的测试、遗漏了最终任务段,或者错误地报告了剩余的失败情况。验收标准应检查交付成果、测试的区分能力、最终状态以及完成报告的准确性。.
局限性、安全性及证据范围
Gemini 3.6 Flash 保留了基础模型的故障模式,包括虚构事实、执行不完整以及自信但缺乏依据的结论。该模型卡片还指出,系统偶尔会出现运行缓慢或超时的情况。由于其知识截止日期为 2026 年 3 月,因此针对更新事实,需要提供依据、当前可信来源或相关文档。.
谷歌报告称,与 Gemini 3.5 Flash 相比,该模型的安全性总体表现良好,包括文本到文本和多语言安全性有所提升,图像到文本安全性保持不变,而在拒绝语气和无故拒绝方面则出现轻微退步。 经过进一步测试,该模型的安全性仍低于谷歌的“关键能力水平”。这些是发布方报告的评估结果,并非针对特定部署的独立保证。.
与聊天相比,计算机使用需要更严格的操作控制措施。基于屏幕截图的代理可能会遇到提示注入、欺骗性控件、弹出窗口以及不可逆操作。应采用隔离环境、最小权限凭证、域和操作白名单、确认机制、审计日志、支出限额以及回滚方案。.
我们的浏览器测试并未调用 Google 的原生“计算机使用”端点,因此无法对原生的延迟、安全性或成功率做出任何声明。该测试针对的是截图解析和本地基于文本的操作解析器。同样,Broly 的 PDF 转换错误仅适用于该网关请求路径。.
我们的延迟数据包含Broly网关的路由过程,且源自一个小型测试套件,并非重复分发。我们未测量TTFT。成本是根据报告的使用情况和官方标准费率估算得出的,并非基于发票,且该测试套件未使用Search Grounding。.
官方基准测试、第三方排行榜、我们的入门测试以及社交媒体上的轶事,各自回答了不同的问题。保持这些标签的可见性,可以避免产生虚假的精确性:谷歌的搜索结果描述的是谷歌的评估结果,我们的记录描述的是一套可重现的测试路径和测试用例,而公开帖子描述的则是个人体验。.
哪些人适合使用 Gemini 3.6 Flash?
对于已经使用 Gemini 3.5 Flash 的团队而言,Gemini 3.6 Flash 是一个极具吸引力的选择,尤其是在输出成本、多模态输入、工具调用或代理式规划至关重要的情况下。它也适用于能够定义明确成功标准并监督风险敏感型操作的新应用场景。.
- 编写具有有限任务、隔离工作区和具有区分能力的自动化测试的代理程序。.
- 生成文本或结构化数据的图表、图像、视频、音频和PDF分析处理流程。.
- 带有确认门和本地验证功能的受监督浏览器或桌面代理。.
- 需要函数调用、文件搜索、缓存或基于上下文的搜索的知识工作系统。.
- 各团队可将每项成功任务的成本与3.5 Flash及其他供应商进行对比。.
当任务可由 Flash-Lite 可靠处理时、实时语音需要使用 Live API 时,或者需要原生图像或音频生成时,该方案的适用性较弱。此外,对于没有回滚机制和独立验证的无监督高风险自动化场景,该方案也不太适用。.
- 将简单的分类和提取工作转移到成本较低但质量有保障的层级。.
- 不要以为1M的上下文窗口就能取代检索工程。.
- 如果没有经过可能失败的测试,请不要接受用户自行申报的“已验证”状态。.
- 请勿将 Broly 网关的延迟或 PDF 转换行为推广到原生的 Google 端点。.
- 未经明确确认,请勿执行不可逆的计算机操作。.
最终判决
本次对 Gemini 3.6 Flash 的评测发现,它是一个有力的生产候选方案,但并非自动迁移的理想选择。该模型兼具较低的输出成本、广泛的输入和工具支持范围,并在 DeepSWE、MLE-Bench、OSWorld 以及长上下文检索任务上取得了显著的官方性能提升。 我们的有限范围测试为精确提取、图表阅读、针对性代码修复以及基于截图的局部行动规划提供了令人鼓舞的证据。.
相关警示同样具体。严格的输出上限导致了两次初始截断;推理过程几乎耗尽了整个流式完成预算;我们的128K合成检索测试两次失败;而浏览器方案生成了一个未见过的ID。由于Broly转换路径在模型响应之前就已失败,因此PDF路径始终未在原生环境中进行测试。.
当匹配评估显示 Gemini 3.6 Flash 在任务完成经济性方面优于您当前的模型时,请采用该方案。请跟踪通过率、令牌数、重试次数、工具调用次数、非必要编辑、人工校正时间,以及每个验证声明是否都由区分性测试支持。 对于混合工作负载,请先从 Flash-Lite 开始,并在观察到实际需求时逐步升级。.
常见问题
Gemini 3.6 Flash 是否已正式发布?
是的。谷歌将 Gemini 3.6 Flash 列为稳定版本,并已面向生产环境正式发布。其型号 ID 为 gemini-3.6-flash, ,可通过 Google AI Studio 和 Gemini 开发者 API 进行访问。API 功能覆盖范围在“交互”和 生成内容.
Gemini 3.6 Flash 的价格是多少?
标准付费定价为:每百万输入代币 $1.50,每百万输出代币(包括思考代币)$7.50。 批量(Batch)和灵活(Flex)模式的费用分别为输入 $0.75 和输出 $3.75,而优先(Priority)模式的费用分别为输入 $2.70 和输出 $13.50。缓存和接地可能会产生额外费用。.
什么是 Gemini 3.6 Flash 上下文窗口?
Gemini 3.6 Flash 支持最多 1,048,576 个输入令牌和 65,536 个输出令牌。这是容量上限,而非检索保证。 谷歌的 1M GDM-MRCR 结果为 54.0%,而我们另一项 128K 网关合成任务则失败了,因此关键系统仍需进行检索和验证。.
Gemini 3.6 Flash 是否支持图片、音频、视频和 PDF 文件?
是的,谷歌列出了文本、图片、音频、视频和PDF作为支持的输入格式。该模型生成的输出是文本、结构化数据和工具调用,而非原生图片或音频。我们的Broly PDF转换路径虽未被支持,但该网关结果并不能证明存在原生的Gemini PDF限制。.
Gemini 3.6 Flash 是否支持电脑使用?
是的。Google 的 Gemini API 支持在浏览器、移动设备和桌面环境中使用 Gemini 3.6 Flash 实现“计算机使用”功能,但该功能目前仍处于预览阶段。客户端会执行建议的操作,并必须应用确认机制和安全控制措施。我们本地开发的截图测试框架并非原生的“计算机使用”测试。.
Gemini 3.6 Flash 比 Gemini 3.5 Flash 更好吗?
在多项谷歌对比测试中,该模型表现更强,且每输出一个令牌的成本更低,但“更好”与否取决于具体的工作负载。在我们的有界编码测试中,这两款模型均以5/5的成绩完成,而3.5分的情况则需要采用容错代码提取。请运行匹配的任务并比较经过验证的完成成本,而不要仅凭模型名称来判断。.
是否支持温度、top_p 和 top_k?
谷歌表示 温度, top_p, 和 top_k 这些字段在这些模型中已被弃用且会被忽略,预计未来版本的模型将不再支持它们。在迁移过程中请移除这些字段。请使用清晰的说明、模式、结构化输出以及应用程序验证器来控制行为。.
有免费套餐吗?
Google 提供的免费标准级输入和输出访问服务受速率限制和可用性影响。定价页面指出,免费级内容可能会用于改进 Google 产品,而付费级内容则另有说明。在发送生产环境数据或敏感数据之前,请仔细阅读当前的速率、数据使用及区域条款。.

