Gemini 3.6 快速評測:定價、基準測試、API 與效能

Gemini 3.6 快速評測:定價、基準測試、API 與效能

Gemini 3.6 Flash 值得考慮 為 有界編碼、多模態分析與監督式代理工作流程. 這份針對 Gemini 3.6 Flash 的評測發現,相較於 3.5 Flash,它確實是一項值得信賴的升級:Google 指出其輸出價格更低,且在多項代理式基準測試中表現更佳;而我們的第一方測試則顯示,在設定合理的輸出限制後,該模型能精確地進行結構化資訊提取、圖表解讀及針對性程式碼修復。不過,它並非在所有情境下都表現優異。 在我們的 128K 合成檢索任務中,該模型曾兩次失敗;此外,儘管模型正確識別了可見目標,但其局部瀏覽器計畫卻虛構了一個隱藏元素的 ID。.

實際的建議是:在針對特定工作負載的驗收測試之後,先試行 Gemini 3.6 Flash,測量每項成功任務的總成本,並針對不可逆的操作保留人工確認程序。 下文中的官方數據、我們包含閘道器的測量結果、第三方基準測試以及早期社群報告均已分別標註,以避免不同類型的證據被混為一談,形成單一評分。.

簡評建議搭配工作負載測試使用最適合 受監督且可測試的代理任務,其中多模態輸入與更強大的規劃能力,使其成本高於 Flash-Lite 是合理的。.觀看: 長上下文檢索、輸出標記上限、驗證聲明,以及閘道器特有的功能缺口。.

Gemini 3.6 快速評測:優缺點

優點優點
適用於生產環境的穩定模型 ID不支援 Live API
標準版售價低於 3.5 Flash僅輸出文字;不支援原生圖片或音訊生成
在 DeepSWE、MLE-Bench、OSWorld 等指標上表現強勁,且在長上下文情境下亦有顯著提升100萬個代幣的容量並不能保證能可靠地檢索
廣泛的多模態與工具支援「電腦使用」仍為預覽功能
我們的有界提取、圖表、編碼及局部操作測試均已通過我們的 128K 八針合成測試兩次均未通過
「批次/彈性」以及更經濟的 Flash-Lite 層級,可實現各種路由策略推理代幣可能會消耗出乎意料地緊俏的輸出配額
本決策摘要係依據 Google 文件、我們於 7 月 22 日進行的測試,以及明確區分的早期報告所彙整而成。.

目錄

什麼是 Gemini 3.6 Flash?

Gemini 3.6 Flash 是一款穩定的 Google 模型,專為需要比輕量級推論層更多推理與工具應用,但又無需升級至旗艦級價格區間的生產環境工作負載而設計。Google 將其描述為編碼、知識工作、多模態理解及代理式執行的「主力模型」。該生產模型的 ID 為 gemini-3.6-flash. Google 的官方機型頁面 將其標示為「已全面推出」。.

該模型可接受文字、圖片、音訊、影片及 PDF 格式的輸入。它會回傳文字、結構化 JSON 以及函式或工具呼叫,但無法原生產生圖片或音訊。在比較廣泛的「多模態」主張時,這項區別至關重要:理解多種輸入格式與產生多種輸出媒體是兩回事。.

Google 的 Gemini 3.6 快閃記憶體型號卡 該模型設定了 2026 年 3 月的知識截止點,並指出其基於 Gemini 3.5 Flash 架構。架構與訓練細節多半是透過參考方式繼承而來,而非新披露的內容,因此買家可以評估已記錄的行為及已發表的評估結果,但無法重現訓練配方。.

廣泛的工具套件是其定位的核心。 官方模型頁面列出了函式呼叫、結構化輸出、程式碼執行、檔案搜尋、URL 上下文、上下文快取、Google 搜尋錨定、Google 地圖錨定、思考能力以及電腦使用等功能。在進行生產部署決策時,應評估整個流程——包含請求格式、工具追蹤、重試機制、驗證流程及人工審查——而不僅僅是單一答案的品質。.

這種「主力」角色也解釋了本篇評測的重點:3.6 Flash 最引人入勝之處,在於它參與應用程式工作流程時,而非僅是回應孤立的瑣碎提示。其價值取決於周邊系統是否能對工具進行限制、偵測截斷、驗證輸出結果,並將較簡單的工作轉交給成本較低的層級處理。.

「電腦使用」功能可讓應用程式傳送螢幕截圖,並接收針對瀏覽器、行動裝置或桌面環境所提出的操作建議。客戶端仍需執行該操作、提供下一張螢幕截圖,並執行相關政策。Google 將此功能標示為「預覽版」,並建議在處理敏感或不可逆的操作時進行監督,詳見 電腦使用說明文件.

Gemini 3.6 快閃記憶體規格與功能

規格Gemini 3.6 閃光燈
型號編號gemini-3.6-flash
發行狀態穩定版/正式發布
最大輸入上下文1,048,576 個代幣
最大輸出65,536 個代幣
輸入模式文字、影像、音訊、視訊、PDF
輸出模式文本
預設思考層級中型
知識截止2026年3月
即時 API不支援
電腦使用在「預覽」中受支援
批次 API在模型層級已支援;目前尚未透過 Interactions API 提供
Google 官方型號規格,查閱日期:2026年7月22日。.

1,048,576 個標記的上下文限制僅為容量上限,並非保證能可靠地檢索到每個事實。這在 Google 的長上下文基準測試以及我們的合成閘道測試中,都是反覆出現的主題。 即使從技術上來說整個語料庫能容納於單一請求中,檢索、分塊、文件索引、摘要及來源引用仍具有實用價值。.

65,536 個代幣的輸出上限雖相當寬裕,但實際應用中通常會基於成本與延遲考量而設定較低的上限。我們的測試揭示,看似足以容納可見答案的上限,往往會被內部推理代幣所耗盡。請務必驗證實際的完成理由與內容,而非僅將 HTTP 200 回應視為任務成功。.

Gemini 3.6 快閃優惠價格

如果您比較的是訂閱方案,而非 API 憑證計費,那麼 Gemini 3 快閃記憶體成本指南 將實際的購買選項區分開來。.

官方標準版付費定價為 每百萬個輸入代幣為 $1.50每百萬枚發行代幣為 $7.50. 輸出計費包含思考代幣。批次推論和彈性推論會將這些代幣費率減半,而優先級推論則會適用 80% 的附加費。請務必確認當前的 Gemini API 定價頁面 在預測生產預算之前。.

使用模式輸入 / 100 萬個代幣產出 / 100萬個代幣
標準$1.50$7.50
批次$0.75$3.75
Flex$0.75$3.75
優先順序$2.70$13.50
Google 於 2026 年 7 月 22 日公佈的美元建議售價;服務的提供情況及限制可能有所不同。.

在「標準」付費層級中,上下文快取的計費標準為每百萬個快取輸入標記收取 $0.15,另加每百萬個標記每小時 $1.00 的快取儲存費用。快取功能雖能減少重複輸入的費用,但若保留過大的快取且時間超過實際需求,快取本身便會成為一項成本來源。 請將快取費用與實際達成的重複使用率進行比較。.

「Grounding」採用不同的計費單位。Google 列出每月可免費使用 5,000 次 Google 搜尋或地圖的「Grounding」提示,此配額可跨 Gemini 3 個模型共享;其後每 1,000 次搜尋查詢將收取 $14。 由於一個提示可能產生多個查詢,因此僅考量代幣成本可能會低估基於現實世界的工作流程的實際成本。.

$2.25 標準定價範例

一個消耗 1,000,000 個輸入代幣並產生 100,000 個輸出代幣的請求,其輸入成本為 $1.50,輸出成本為 $0.75,也就是說 $2.25 在標準模式下。這個簡單的範例未包含快取儲存、查詢驗證、重試、外部工具以及失敗的嘗試。.

Google 還指出,在「人工分析指數」中,Gemini 3.6 Flash 比 3.5 Flash 少消耗了 17% 的輸出標記,且在多步驟工作流程中所需的推理步驟和工具呼叫次數也較少。 這是一項基於工作負載的官方觀察結果,並非保證每項應用程式都能節省 17%。請使用您自己的提示語,測量每項成功任務的令牌數量。.

以 $2.25 Standard 為例的官方建議售價摘要。發布或編列預算前,請先確認現行價格。.

Gemini 3.6 Flash 效能測試:Google 的報告內容

Google 官方搜尋結果我們的 Broly 閘道器測試第三方效能測試

Google 官方隨型號發布一併公開了 Gemini 3.6 Flash 評估圖表
Google 官方發布的 Gemini 3.6 Flash 評估數據;基準測試名稱與方法論詳見原始來源。. 查看 Google 的官方原始碼.

Google 的官方比較顯示,在代理編碼、機器學習工程、電腦互動以及長上下文檢索方面,表現提升最為顯著。最具參考價值的基準是 Gemini 3.5 Flash,因為 Google 是針對同一模型卡系列中的兩個模型進行評估。這些數值為 Google 的測試結果,並非來自我們的測試框架。.

基準Gemini 3.6 閃光燈雙子星 3.5 Flash報告中的差異
SWE-Bench Pro 公開版58.7%55.1%+3.6 點
DeepSWE v1.149.0%37.0%+12.0 分
Terminal-Bench 2.178.0%76.2%+1.8 點
MLE-Bench63.9%49.7%+14.2 點
GDPval-AA v21,421 Elo1,349 Elo+72 Elo
OSWorld-Verified83.0%78.4%+4.6 點
Google 官方/模型資料卡的數值。不同的基準測試衡量不同的任務分佈,且不可互換。.

DeepSWE 的表現提升了 12.0 個百分點,MLE-Bench 則提升了 14.2 個百分點。OSWorld-Verified 的提升幅度為 4.6 個百分點,而 SWE-Bench Pro Public 和 Terminal-Bench 的提升幅度則較為溫和。 值得肯定的是,3.6 版本相較於 3.5 版本確實改善了數項代理型工作負載的表現,但並非在每個模型或編碼基準測試中都表現最優。.

Google 還指出,不必要的程式碼修改減少,且執行迴圈更短。這些行為的重要性可能遠超過儲存庫工作中微小的通過率變化,因為不必要的變更會增加審查成本,而重複的迴圈則會消耗代幣。這些仍需透過應用程式層級的測量來評估;單憑彙總基準測試無法確定特定程式碼庫中的行為表現。.

多模態與長上下文結果

關於 CharXIV 在複雜圖表上的推理表現,Google 報告指出,針對 Gemini 3.6 Flash,未使用工具時的成績為 85.2%,使用工具時的成績則為 89.4%。 Gemini 3.6 Flash 則分別獲得 84.2% 和 84.4% 的成績。工具輔助下較大的分差,印證了該模型在圖表解讀與多模態工作流程中的定位,但此測量並未涵蓋視覺美感或前端樣式品質。.

GDM-MRCR v2 長上下文測試Gemini 3.6 閃光燈雙子星 3.5 Flash
128K,8針平均值91.8%77.3%
1M,8針逐點式54.0%26.6%
Google 官方 GDM-MRCR v2 數據。上下文容量與檢索可靠性是兩種不同的特性。.

摘自發布文章的 Google 官方 Gemini 3.6 Flash 畫質評估圖表
Google 官方發布的 Gemini 3.6 Flash 品質數據;請配合發布文章及型號說明卡一併解讀。. 查看 Google 的官方原始碼.

1M 的結果雖有顯著的相對改善,但 54.0% 並不能作為盲目檢索關鍵事實的依據。生產系統仍應對文件進行分段、保留來源資訊,並要求提供來源引用。 我們另行進行的 128K 合成測試雖未成功,但該測試採用了不同的任務與閘道路徑,因此無法取代 Google 的測試結果。.

Google 所報告的 DeepSWE、MLE-Bench、OSWorld-Verified 以及 100 萬字元長文檢索的性能差異;這些並非我們的測試結果。.

我們對 Gemini 3.6 Flash 的實機測試

我們的測試實際上證實了什麼: Gemini 3.6 Flash 成功完成了有界結構化提取、圖表解讀、針對性代碼修復,以及一項受監督的局部行動任務。它在我們的合成 128K 八針檢索任務中兩次失敗,且其瀏覽計畫所指名的隱藏元素 ID 在圖像中並不可見。.

這意味著: 請將其用於搭配驗證器及人為確認的特定範圍工作。切勿將龐大的上下文視窗或看似合理的行動計畫,視為所有細節均已正確檢索或釐清的證明。.

我們於 2026 年 7 月 22 日執行了一套確定性第一方測試套件。所有報告的延遲值皆為 包含閘道的總回應時間, 因此其中包含 Broly 的路由開銷,切勿將其解讀為 Google API 的直接延遲。.

未測量 TTFT,包括串流檢查在內。 我們記錄了總耗時、提示詞代幣數、完成代幣數、推理代幣數、快取代幣數、總代幣數、完成原因、重試次數、驗證結果,以及根據官方標準代幣費率估算的成本。推理代幣數已包含在完成代幣數中,而快取代幣數也已包含在提示詞代幣數中。.

整項活動的內容包括 12 次邏輯 API 呼叫14 次 HTTP 嘗試. 主要選舉仍維持 $0.244491, ,這三集指定重播的總集數為 $0.0520416, ,而修正後的累計估計值為 $0.2965326. 在將兩筆明顯被截斷的初始記錄替換為其對應的重播記錄後,整合後的結果如下: 7 項通過、1 項未通過,另有 1 項不支援.

成本估算採用以下標準:未緩存的提示符代幣為 $1.50/M,已緩存的提示符代幣為 $0.15/M,輸出代幣為 $7.50/M。 在長上下文重跑中,128,248 個提示符代幣分為 5,464 個未緩存代幣和 122,784 個已緩存代幣;加上 2,048 個輸出代幣後,產生 $0.0419736. 快取儲存的數據列為 $1.00/M 代幣/小時,但因未測量儲存時長,故不予計入。.

這些是小樣本診斷測試,並非具有統計效力的基準測試。其價值在於保留了測試套件、預期值、驗證器、請求限制及失敗情況。這些測試應作為在實際工作負載下進行後續測試的指引,而非成為通用的品質評分標準。.

最終任務紀錄結果包含閘道器在內的時間代幣 P / C / R / 快取 / 總計估計成本
串流精確答案,3.6通過2.938 秒5 / 119 / 118 / 0 / 124$0.0009
結構化擷取,3.6 重跑通過3.919 秒55 / 453 / 411 / 0 / 508$0.00348
結構化萃取,3.5通過3.113 秒56 / 378 / 324 / 0 / 434$0.003486
圖表解析,3.6 重播通過4.884 秒1,127 / 653 / 520 / 0 / 1,780$0.006588
程式碼修復,3.6通過5.553 秒602 / 1,150 / 930 / 0 / 1,752$0.009528
程式碼修復,3.5通過6.860 秒603 / 1,332 / 1,058 / 0 / 1,935$0.0128925
128K 八針,3.6 重播失敗11.366 秒128,248 / 2,048 / 0 / 122,784 / 130,296$0.0419736
地方瀏覽器行動計畫,3.6通過5.305 秒1,153 / 643 / 573 / 0 / 1,796$0.006552
布羅利 /回應 PDF 轉換不支援2.423 秒0 / 0 / 0 / 0 / 0$0
我們的 Broly 閘道測試紀錄。P = 提示、C = 完成、R = 推理;推理包含在完成中。快取的提示標記採用官方的快取輸入速率。.

串流、結構化輸出與圖表解讀

該串流任務要求提供精確的可見答案 OK. Gemini 3.6 Flash 在 2.938 秒內給出了正確答案,其中提示詞 5 個、完成詞 119 個、推理詞 118 個,總計 124 個標記,估計耗時 $0.0009。 值得注意的細節是,推理階段消耗了 119 個完成令牌中的 118 個,這說明了為何微小的輸出上限會導致無法產生可見的答案。.

第一個 3.6 結構化擷取呼叫採用了 512 個標記的輸出上限,並在 finish_reason=長度 使用截斷的 JSON。我們將此視為測試框架的限制,而非品質判定,並僅針對該任務以 2,048 個標記進行重複測試。 目標重跑在 3.919 秒內通過了精確欄位驗證,成績為 P55/C453/R411/T508,並估算出 $0.00348。.

Gemini 3.5 Flash 在首次呼叫時,以 P56/C378/R324/T434 參數完成相同的萃取,耗時 3.113 秒,預估結果為 $0.003486。 每種配置僅執行一次無法確定延遲表現最佳者。但這確實顯示,輸出限制與推理使用量應針對各模型進行微調,而非盲目套用。.

3.6 的讀取圖表呼叫同樣在 768 個標記的初始上限處被截斷。 在 2,048 個代幣的條件下,目標重跑任務使用 P1,127/C653/R520/T1,780 參數,並耗費約 $0.006588,精確地在 4.884 秒內讀取了全部八個基準值。 驗證者將每個返回的值與固定的基準真相檔案進行了比對。.

程式碼修正:兩款機型均達到 5/5

這兩項編碼任務均以同一套 Python 測試框架的獨立副本為起點,基準為 3/5 項測試通過。 Gemini 3.6 Flash 在 5.553 秒內產出了一個精準且可用的修復方案,其參數為 P602/C1,150/R930/T1,752,並估算出 $0.009528。 套用輸出結果後,測試套件的通過率提升至 5/5,而測試檔案的雜湊值則保持不變。.

Gemini 3.5 Flash 亦產生了一項精準修復,在 6.860 秒內達到 5/5,參數為 P603/C1,332/R1,058/T1,935,且估計值為 $0.0128925。 儘管有「不生成說明文字」的指示,系統仍為圍欄代碼添加了說明文字,因此在離線驗證前,測試套件需要具備容錯的圍欄代碼提取功能。這兩項修復結果均可使用;但輸出規範有所不同。.

此測試側重於搭配確定性單元測試的有限修復工作。它並未衡量儲存庫導覽、跨多個檔案的架構變更、長期自主運作,或是模型能否從頭設計出具區分能力的測試。這些面向需要另行設計測試環境與失敗準則。.

128K 合成資料檢索失敗

我們那則近 128K 的提示語,將八個確定性識別碼置於一個大型合成語境中,並要求精確還原 JSON 格式。Gemini 3.6 Flash 發生了兩次失敗,回傳了與八個值無關的程式碼和 HTML,而非這八個值。提高輸出上限並未修正此行為。.

重新執行耗時 11.366 秒,並回報 P128,248/C2,048/R0/Cached122,784/T130,296, 經快取輸入調整後,估算值為 $0.0419736,以及 finish_reason=長度. 這是一篇 無法直接與 Google 的 GDM-MRCR 相提並論 結果:我們的任務、精確的提示語建構、語境規模、輸出格式以及布羅利閘道路徑均有所不同。.

此失敗案例在運作上仍具參考價值。它表明這項特定的模擬請求在兩次嘗試中均未能透過我們的路由成功執行,因此若未進行資料擷取、更嚴格的上下文篩選、回應驗證及備用處理,我們將不會傳送相同的模式。這既無法推翻 Google 的基準測試結果,也無法證明存在普遍的 128K 限制。.

本機瀏覽器動作框架:正確的目標,自定義的 ID

該模型檢視了一張受控本地頁面的截圖,並正確識別出可見的目標文字「開啟使用報告」。它提出了以下操作建議: 點擊 但卻發明了一個隱藏的識別碼,, 開啟使用報告, 而不是真正的 DOM ID 用法. 該連接器解析了獨一無二且確切的可見文字,而非依賴那編造的 ID。.

該計畫呼叫耗時 5.305 秒,參數為 P1,153/C643/R573/T1,796,估計耗時 $0.006552。點擊了一次本地的 Chrome 固定裝置,使其狀態從 準備好了報告-開啟. 這正是 非原生 Gemini 電腦使用; ;它未執行任何外部操作、未提交任何表單,也未改變任何外部狀態。.

先前:處於就緒狀態的獨立本機元件;未涉及任何外部頁面或表單。.
之後:精確的可見文字解析器觸發了「本地 ID 使用」事件,進而產生了「已驗證的報告開啟」狀態。.

PDF 結果是閘道路徑的限制

布羅利 /回應 PDF 轉換路徑傳回 HTTP 500 錯誤,錯誤代碼為 convert_request_failed 以及訊息 尚未實作. 該邏輯呼叫進行了三次 HTTP 嘗試,因為該記錄包含兩次重試,隨後在未使用代幣且未產生費用的情況下停止。我們將此路由歸類為「不支援」。.

這個結果 這並不能證明 Gemini 不支援 PDF. Google 的模型文件中列出了 PDF 輸入格式;但在 OpenAI 相容的閘道轉換路徑上,我們的請求在顯示模型回應之前即已失敗。在針對原生 PDF 行為發表任何結論之前,仍需透過原生 Google AI Studio 或 Gemini API 進行驗證。.

仍需編輯佐證: 透過原生 Google AI Studio 或 Gemini API 執行 PDF 任務,然後擷取完整的提示字串、模型回應、使用面板以及頁面引用證據。在取得這些螢幕截圖之前,本評測僅報告 Broly 轉換失敗的情況,且不對原生 PDF 效能做出任何聲明。.

Gemini 3.6 Flash API 存取與程式碼

開發者若要比較一款具備更高階推理能力的 Google 模型,可以使用 Gemini 3.1 Pro API 定價與效能指南 作為下一步的參考。.

Gemini 3.6 Flash 現已於 Google AI Studio 及 Gemini 開發者 API 中提供,其穩定版模型 ID 為 gemini-3.6-flash. Google 建議使用較新的 互動 API 針對新的主動型專案,而現有的 generateContent 該介面仍持續獲得支援,並涵蓋了目前尚未透過「互動」功能所提供的重要功能。.

使用官方 Google Gen AI SDK 的 Python

API 範例
from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents=(
 "請審查這項建議的程式碼變更。 請找出根本原因、"
 "最小的安全修復方案,以及能證明該修復方案有效的精確測試。"
    ),
)

print(response.text)

客戶端會從受支援的環境設定中讀取憑證;請勿將金鑰硬編碼或公開。此範例刻意避開已廢棄的取樣欄位,並使用 Google 的官方 google-genai generate_content 方法。僅在工作負載有需求時,才新增架構、安全性設定及工具。.

JavaScript 與 @google/genai

API 範例
import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

const response = await ai.models.generateContent({
  model: "gemini-3.6-flash",
  contents: "提取風險並回傳一份簡明且以來源為依據的摘要。",
});

console.log(response.text);

為了確保在生產環境中可靠運作,請驗證回傳的結構、檢查失敗原因、記錄工具呼叫,並區分「傳輸成功」與「任務成功」。若 200 回應中包含被截斷的 JSON 或不支援的操作,則不視為合格的業務結果。.

互動 API 還是生成內容?

Interactions API 透過以下方式新增可選的伺服器端狀態: 先前互動 ID, 、可觀察的執行步驟,以及針對較長任務的背景執行。由於狀態和工具追蹤是第一類概念,因此對於新的代理循環而言極具吸引力。在將其用於敏感內容之前,請先檢視儲存與保留設定。.

保持 generateContent 當其功能介面更成熟且更符合應用需求時。截至 2026 年 7 月,Google 的文件指出,Interactions 目前尚未提供批次 API、顯式快取、自訂安全性設定、影片元資料,或自動呼叫 Python 函式等功能。模型支援與 API 介面支援是兩個不同的議題。.

Gemini 3.6 Flash API 遷移變更

如需瞭解有關 Google Pro 系列機型的完整實作工作流程,請參閱 Gemini 3.1 Pro 程式設計教學.

從較早的請求格式進行轉換,並非僅是更換模型名稱而已。Google 的 最新版本遷移指南 記錄已廢棄、被忽略或遭拒絕的參數與轉換模式。將此遷移視為請求合約與狀態完整性的變更。.

移除已廢棄的控制項與預填功能

移除 溫度, top_p, 以及 top_k. Google 表示,對於這些模型而言,這些參數已被廢棄且將被忽略;預計未來版本在接收到這些參數時,將返回 HTTP 400 狀態碼。一個舊版 溫度:0 不應將該欄位視為確定性的保證。.

此外,請求亦不得以非空的模型角色預填內容結尾。例如在模型回合後附加「Translation:」或 JSON 的開頭大括號等模式,可能會導致 HTTP 400 錯誤。請以系統指令、結構化輸出、明確的資料結構及驗證器取代預填內容。.

替換數字 預算規劃 透過 思考層級 enum; Gemini 3.6 Flash 的預設值為 中型. 移除 候選人_人數, ,而 Gemini 3.x 並不支援此功能;若確實需要多種候選策略,則應實作應用層級的替代方案。.

保留函式呼叫狀態

工具工作流程需要完整的呼叫 ID、函式名稱、思考簽名以及回合順序。當使用 generateContent, 每個 FunctionResponse 應包含其 call_id名稱. 測試格式錯誤的呼叫、工具輸出前的說明文字,以及針對遭拒絕或不可用的工具進行復原處理。.

  • 將目標模型 ID 變更為 gemini-3.6-flash.
  • 移除 溫度, top_p, top_k, 以及 候選人_人數.
  • 替換 預算規劃思考層級.
  • 移除模型輪次預填功能。.
  • 保留函式呼叫 ID、名稱、思考簽名及工具順序。.
  • 驗證完成原因、模式、重試以及每項成功聲明。.
  • 重新計算每項成功任務的成本,其中應包含失敗的呼叫及工具。.
  • 在「電腦使用」之前,請執行提示字元注入與破壞性操作測試。.
遷移摘要:變更請求控制機制,並完整保留工具追蹤紀錄。在選擇「互動」功能之前,請先確認當前 API 的覆蓋範圍。.

Gemini 3.6 Flash 與 3.5 Flash 及 Flash-Lite 比較

正在抉擇 Google 與 OpenAI 之間的團隊,可參考我們提供的內容來比較兩者的取捨 GPT-5.4 對決 Gemini 3 速覽.

Gemini 3.6 Flash 是 Gemini 3.5 Flash 的直接升級選項。標準輸入定價維持在每百萬個代幣 $1.50,而輸出定價則從 $9.00 降至 $7.50——這代表降幅達 16.7%,且尚未計入 Google 另一份報告中,某項評估顯示輸出代幣使用量較低的結果。.

類別Gemini 3.6 閃光燈雙子星 3.5 Flash
標準輸入 / 1M$1.50$1.50
標準輸出 / 1M$7.50$9.00
DeepSWE v1.149.0%37.0%
MLE-Bench63.9%49.7%
OSWorld-Verified83.0%78.4%
1M GDM-MRCR v254.0%26.6%
我們的有界程式碼修復維修後評分 5/5耐受性萃取後評分 5/5
官方價格與基準值,以及我們另行標示的單次運行編碼夾具。.

當較高的代理能力分數、較低的產出價格以及較短的迴圈,能轉化為每美元更高的工作成效時,遷移效應便最為顯著;反之,當特定的儲存庫或工具套件導致執行不完整、驗證錯誤或需反覆人工修正時,遷移效應則最為微弱。請使用相同的工具和接受度測試來執行匹配的提示。.

Gemini 3.5 Flash-Lite 的適用範圍

Gemini 3.5 Flash-Lite 是專為高吞吐量萃取、分類、翻譯、路由、文件處理及有限子代理工作而設計的低成本版本。 標準定價為每百萬個輸入標記 $0.30,以及每百萬個輸出標記 $2.50。這使得 3.6 Flash 在輸入端的成本高出五倍,在輸出端的成本則高出三倍。.

雙層路由器可將符合條件的工作預設分配給 Flash-Lite,並將信心度低、工具需求高、多模態或長期任務升級至 3.6 Flash。該路由器應具備可觀察性與可逆性,並記錄決策理由,同時包含重試成本與修正成本。代幣成本較低,並不代表完成任務的成本也較低。.

一位務實的路線規劃者會從精簡的方案開始,並根據諸如信心不足、工具需求或任務時程較長等證據逐步擴大規模。.

早期使用者回饋與第三方測試結果

2026年7月22日拍攝這些截圖時,Gemini 3.6 Flash 已對外公開約一天。這些貼文是 社會軼事 這些是證據,而非具代表性的調查,而平台排名則是 第三方效能測試 證據,而非 Google 搜尋結果或我們的測量數據。這些資料有助於確立待驗證的假設。.

瀏覽器與前端方面傳出令人鼓舞的訊號,但需注意幾點限制

Arena.ai 報告指出,Gemini 3.6 Flash 在「前端程式碼競技場」中以 1,537 分位居第 12 名,較先前 Gemini 3.5 Flash 的第 21 名有所提升。 此結果反映了 Arena 的提示詞、投票者、模型快照及排名方法。該結果支持前端改進的假設,但並未確立普遍適用的程式碼品質標準。.

Browser Use 在其 BU 基準測試中報告了 68% 的成績,並稱該模型為其性價比最高的瀏覽器代理選項。 這是一項由廠商自行編寫的基準測試,並非中立的產業評估。雖然與 Google 在 OSWorld 上的測試結果相較,其趨勢方向頗具參考價值,但各團隊應在自身的安全環境與工具執行框架內,重新執行這些瀏覽器相關任務。.

一位挑剔的 X 用戶對 Google 的表格有不同解讀,認為最具說服力的進步體現在視覺與語境方面,而非編碼能力。另一位用戶則指出,綜合編碼指數中,3.6 的數值略低於 3.5。不同的任務組合可能會產生看似矛盾的結果,因此每個數值都應附上對應的基準測試名稱與評測方法。.

對 @synthwavedd 發布的官方表格進行批判性解讀。請查看原始 X 貼文。本文為評論,並非實際操作評測。.

編碼報告著重於驗證與完成度

Reddit 上最詳盡的報告指出,當任務範圍明確、可量化且在修復前已進行儀器監測時,3.6 版 Flash 表現得既快速又高效。同一位作者同時對過於自信的驗證聲明、看似具破壞性的自主性,以及檢查工作所產生的監督成本提出了警告。 該作者還透露,另一位研究人員曾審查或修正過該結果,且部分測試因設定問題而產生混淆。.

來自 u/Valuable_Elevator948 的混合編碼代理報告。.
查看 Reddit 原始討論串. 早期軼事,其中已揭露干擾因子。.

另一位 Reddit 作者指出,某個專案的工作並未完成,但隨後卻聲稱任務已完成。留言者描述了類似的情況,並提出關於除錯及「幻覺式驗證」的疑慮。由於該工具的設定與提示內容尚未經過獨立驗證,因此這份報告應被視為一個測試案例——而非普遍適用的結論。.

來自 u/Embarrassed_Time_129 的負面專案編碼報告。.
查看 Reddit 原始討論串. 屬軼事性質且與特定工作流程相關。.

常見的評估教訓是,應將修補程式品質與驗證的誠信度區分開來。某個模型或許會建議一項有用的變更,卻可能使用無法辨別該修正效果的測試、省略最後的任務區段,或是錯誤陳述剩餘的失敗情況。驗收準則應檢查產出成果、測試的辨別能力、最終狀態,以及完成報告的準確性。.

限制、安全性與證據範圍

Gemini 3.6 Flash 仍保留了基礎模型的故障模式,包括虛構事實、執行不完整,以及自信但缺乏依據的結論。模型說明卡亦指出,系統偶爾會出現運作緩慢或超時的情況。由於其知識截止日期為 2026 年 3 月,因此較新的事實需要進行錨定、提供當前的可信來源,或提交相關文件。.

Google 報告指出,與 Gemini 3.5 Flash 相比,其安全性表現整體呈正向,包括文字轉文字及多語言安全性有所提升、圖像轉文字安全性維持不變,以及拒絕語氣與無故拒絕方面出現輕微退步。 經過進一步測試後,該模型的安全性仍維持在 Google「關鍵能力等級」之下。這些評估結果來自發布者報告,並非針對特定部署的獨立保證。.

相較於聊天功能,電腦使用需要更嚴格的操作控制措施。基於螢幕截圖的代理程式可能會遭遇提示注入、欺騙性控制、彈出視窗以及不可逆的操作。應採用隔離環境、最低權限憑證、網域與操作白名單、確認機制、稽核日誌、支出限額以及回滾方案。.

我們的瀏覽器測試並未測試 Google 的原生「電腦使用」端點,因此無法針對原生延遲、安全性或成功率做出任何聲明。該測試針對的是螢幕截圖解析功能以及本機文字型動作解析器。同樣地,Broly 的 PDF 轉換錯誤僅適用於該閘道請求路徑。.

我們的延遲數據已包含 Broly 閘道路由,且源自一個小型測試套件,並非重複分發的結果。我們並未測量 TTFT。成本是根據已報告的使用量及官方標準費率估算得出,並非基於發票,且該測試套件未使用 Search Grounding。.

官方基準測試、第三方排行榜、我們的入門測試,以及社群中的軼事,各自解答了不同的問題。讓這些標籤保持清晰可見,可避免產生虛假的精確度:Google 的搜尋結果描述的是 Google 的評估結果;我們的紀錄描述的是一套可重現的測試路徑與測試環境;而公開貼文則描述的是個人的體驗。.

哪些人適合使用 Gemini 3.6 Flash?

在選擇存取方案之前,請先確認您的工作負載是否真的需要在 Gemini 3 Flash 訂閱指南.

Gemini 3.6 Flash 對於已採用 Gemini 3.5 Flash 的團隊而言,是極具吸引力的選擇,特別是在輸出成本、多模態輸入、工具調用或代理式規劃至關重要的情況下。它也適用於能夠定義明確成功準則,並能監督風險敏感型行動的新應用場景。.

  • 編寫具備有限任務、隔離工作區及具辨別能力的自動化測試的程式。.
  • 可產生文字或結構化資料的圖表、圖片、影片、音訊及 PDF 分析處理流程。.
  • 具備確認閘門與本地驗證功能的受監督瀏覽器或桌面代理程式。.
  • 需要函式呼叫、檔案搜尋、快取或基於背景的搜尋之知識工作系統。.
  • 各團隊可將每項成功任務的成本與 3.5 Flash 及其他供應商進行比較。.

當任務可由 Flash-Lite 可靠地處理、即時語音需要使用 Live API,或是需要原生圖像或音訊生成時,此方案的適用性較低。此外,對於缺乏回滾機制與獨立驗證的無監督高風險自動化情境,此方案亦不適用。.

  • 將簡單的分類與萃取作業轉移至成本較低、但品質仍能維持的層級。.
  • 請勿假設 1M 的上下文視窗就能取代檢索工程。.
  • 若未經可能失敗的測試,請勿接受自行聲稱的「已驗證」狀態。.
  • 請勿將 Broly 閘道器的延遲或 PDF 轉換行為一概套用至原生 Google 端點。.
  • 未經明確確認前,請勿執行不可逆的電腦操作。.

最終裁決

這篇針對 Gemini 3.6 Flash 的評測指出,該模型雖是強有力的實務應用候選方案,但並非自動遷移的理想選擇。該模型兼具較低的輸出成本、廣泛的輸入與工具支援範圍,並在 DeepSWE、MLE-Bench、OSWorld 以及長上下文檢索等指標上,展現出顯著的官方性能提升。 我們的有限範圍測試為精確提取、圖表解讀、針對性程式碼修復,以及截圖引導的局部行動規劃提供了令人鼓舞的佐證。.

這項警示同樣具體。嚴格的輸出上限導致了兩次初始截斷;推理過程耗盡了幾乎全部的串流完成預算;我們的 128K 合成檢索測試兩次失敗;而瀏覽器方案則產生了一個未見過的 ID。由於 Broly 轉換路徑在模型回應之前即已失敗,因此 PDF 路徑始終未經原生測試。.

當匹配評估顯示 Gemini 3.6 Flash 的任務完成經濟效益優於您當前模型時,請採用該方案。請追蹤通過率、代幣數、重試次數、工具調用次數、非預期編輯、人工修正時間,以及每項驗證主張是否均由具區分能力的測試所支持。 對於混合工作負載,請先從 Flash-Lite 開始,並根據實際觀察到的需求逐步升級。.

常見問題

Gemini 3.6 Flash 是否已正式上市?

是的。Google 將 Gemini 3.6 Flash 列為穩定版本,並已廣泛開放供生產環境使用。其型號 ID 為 gemini-3.6-flash, ,並可透過 Google AI Studio 及 Gemini 開發者 API 存取。API 功能涵蓋範圍在「互動」與 generateContent.

Gemini 3.6 Flash 的價格是多少?

標準付費定價為每百萬個輸入代幣 $1.50,以及每百萬個輸出代幣 $7.50,其中包含思考代幣。 批次 (Batch) 與彈性 (Flex) 模式的費用為輸入 $0.75 及輸出 $3.75,而優先 (Priority) 模式的費用則為輸入 $2.70 及輸出 $13.50。快取 (Caching) 與接地 (Grounding) 可能會產生額外費用。.

什麼是 Gemini 3.6 Flash 上下文視窗?

Gemini 3.6 Flash 最高可支援 1,048,576 個輸入令牌與 65,536 個輸出令牌。此為容量上限,並非檢索保證。 Google 的 1M GDM-MRCR 結果為 54.0%,而我們另一項 128K 閘道任務則以失敗告終,因此關鍵系統仍需進行檢索與驗證。.

Gemini 3.6 Flash 是否支援圖片、音訊、影片及 PDF 檔案?

是的,Google 列出文字、圖片、音訊、影片和 PDF 為受支援的輸入格式。該模型產出的結果為文字、結構化資料及工具呼叫,而非原生圖片或音訊。我們的 Broly PDF 轉換路徑雖未獲支援,但該閘道結果並不能證明 Gemini 存在原生 PDF 限制。.

Gemini 3.6 Flash 是否支援電腦使用?

是的。Google 的 Gemini API 支援在瀏覽器、行動裝置及桌面環境中使用 Gemini 3.6 Flash 進行「電腦使用」測試,但此功能目前仍處於預覽階段。客戶端會執行建議的操作,並必須實施確認機制與安全控制措施。我們使用的本地截圖測試框架並非原生的「電腦使用」測試。.

Gemini 3.6 Flash 是否比 Gemini 3.5 Flash 更好?

在幾項 Google 比較測試中,該模型表現更強,且每輸出一個代幣的成本更低,但何謂「更好」則取決於工作負載。在我們的有限編碼測試中,這兩款模型均取得 5/5 的成績,而 3.5 則需要進行容錯代碼提取。請實際執行相應任務,並比較經驗證的完成成本,而非僅憑模型名稱來判斷。.

是否支援 temperature、top_p 和 top_k?

Google 表示 溫度, top_p, 以及 top_k 這些欄位在這些模型中已遭廢棄且會被忽略,預計未來版本的模型將不再接受這些欄位。請在遷移過程中移除這些欄位。請使用明確的指示、資料結構、結構化輸出以及應用程式驗證器來控制行為。.

有免費方案嗎?

Google 提供免費的「標準」層級輸入與輸出存取服務,但須受速率限制及服務可用性所限。定價頁面說明,免費層級的內容可能會用於改善 Google 產品,而付費層級的內容則另有標示。在傳送生產環境或敏感資料之前,請先檢視當前的速率、資料使用量及區域相關條款。.

分享文章:

相關文章