模型評測 · 基準測試 · 實際 API 測試
Gemini 3.7 Flash 被定位為一款具備推理能力的高速模型,適用於編碼、代理任務、多模態輸入以及日常創作任務。然而,更實用的問題卻更難回答:當這兩款模型收到相同的提示時,它產出的成品是否比 Gemini 3.6 Flash 更出色?
這篇關於 Gemini 3.7 Flash 的評測將證據分為三類。Google 的文件證實了模型規格、定價以及官方的效能測試聲明。Artificial Analysis 則提供了獨立的第三方效能測試背景資訊。我們的實測比較採用了七項相匹配的 API 任務,且兩個模型均使用相同的提示詞與生成設定。.
Gemini 3.7 Flash 已列入透過以下方式進行測試的清單: GlobalGPT Gemini 3.7 快閃機型頁面. 這讓您能在同一個地方,針對多個模型(包括本評測中使用的基準模型)執行相同的提示語。如需相關背景資訊,請參閱我們的 Gemini 3.6 快速評測 和 Gemini 3.6 Flash 與 Gemini 3.1 Pro 比較.

Gemini 3.7 快速評測:簡短結論
在六組已完成的任務對中,有三組由 Gemini 3.7 Flash 產出的答案完成度較高, ,相較之下,Gemini 3.6 Flash 則取得兩勝一和的成績。其優勢體現在編碼、資料推理以及符合聲明規範的 SEO 編輯方面。Gemini 3.6 Flash 撰寫了更簡潔的前端文本方案,並進行了更細緻的狀態擷取,而在代理式規劃方面則以平手收場。.
評論快照
| 度量 | 觀察結果 | 這代表什麼 |
|---|---|---|
| 輸出品質 | 3.7 勝 3 場;3.6 勝 2 場;1 場和 | 評斷依據是每張卡片上所示的完成作品。. |
| 速度 | 混合 | 3.7 在四項任務中完成得更快,但 3.6 在六項任務的平均成績上略低一些。. |
| 代幣效率 | 3.7 使用了 7,948 個輸出代幣;3.6 使用了 10,058 個 | 在所有已完成的任務中,3.7 產出的輸出標記比 21% 少。. |
| 創紀錄的 3.7 成績 | 符合聲明規範的 SEO 編輯 | 該內容遵循既定事實,未添加任何缺乏依據的描述。. |
這是一組六項小型、受控的文本任務,並非通用模型排名。T01 被排除在外,因為沒有任何模型能在共享的輸出上限內完成所要求的答案。.
什麼是 Gemini 3.7 Flash?
Gemini 3.7 Flash 是 Google 專為仍需仰賴推理能力的工作所設計的穩定型高吞吐量模型。Google 列出了文字、圖片、影片、音訊及 PDF 等輸入格式;支援的功能包括函數呼叫、程式碼執行、搜尋錨定、檔案搜尋、結構化輸出,以及電腦使用(預覽版)。 實際的問題在於,這些控制機制如何轉化為最終成果。.
發行日期與供應狀況
截圖中顯示的「人工分析」頁面標示出 Gemini 3.7 Flash(高),其發布清單顯示將於 2026 年 8 月推出。如需確認權威狀態、型號 ID、支援功能及推出詳情,請使用 Google 的 官方 Gemini 3.7 Flash 型號卡 以及相關的 API 文件。可用性可能因產品、地區、帳戶及模型層級而異,因此單憑列出某個模型的頁面,並不能作為該模型普遍可用的證明。.
與 Gemini 3.6 韌體相比,有哪些改變?
這項變革並非僅僅是基準數值的提升。Google 將 Gemini 3.7 Flash 描述為 Gemini 3.6 Flash 的迭代版本,其推理基礎與可自訂的思考能力均有所提升。在我們完成的配對測試中,這體現為在三項任務上更強大的約束處理能力,但並未在所有任務中全勝。.
| 比較區域 | Gemini 3.7 Flash | Gemini 3.6 閃光燈 | 觀察到的證據 |
|---|---|---|---|
| 程式碼錯誤修正 | 沒錯,測試結果更清晰 | 沒錯,但比較長 | 3.7 微幅勝出 |
| 文字前端計畫 | 可處理,但有兩處編輯上的瑕疵 | 更簡潔且內部一致性更高 | 3.6 微幅勝出 |
| 狀態感知式提取 | 完全回憶起來,但有一個被誇大的「成功」標籤 | 更精確的狀態描述語言 | 3.6 微幅勝出 |
| 資料推理 | 沒錯,預設的分頁方式更清晰了 | 正確,並附上更多條件性細節 | 3.7 微幅勝出 |
| 代理式規劃 | 堅固的止水閘門 | 更具體的工具呼叫詳細資訊 | 平手 |
| SEO 編輯 | 已保留所有已鎖定的索賠 | 新增了一個未受支援的形容詞 | 3.7 微幅勝出 |
Gemini 3.7 Flash 規格與上下文視窗
規格之所以重要,是因為它們界定了何種條件下才算公平的比較。若您比較的是方案限額而非模型行為,我們的 Gemini 限制與配額指南 這是更詳細的後續測試。上下文視窗的數值並不代表模型必定能準確地摘要每份長篇文件;它僅說明該 API 設計上能接受的範圍。下方的提取測試將分別檢視召回率、矛盾處理能力以及未知項的處理情況。.
| 規格 | Gemini 3.7 Flash | Gemini 3.6 閃光燈 | 來源 |
|---|---|---|---|
| 返回的 API 模型 ID | gemini-3.7-flash | gemini-3.6-flash | 記錄的 API 回應 |
| 輸入上下文 | 最多 100 萬枚代幣 | 最多 100 萬枚代幣 | Google 模型卡片 |
| 最大文字輸出量 | 64K 代幣 | 64K 代幣 | Google 模型卡片 |
| 已記錄的輸入資料 | 文字、圖片、音訊、影片 | 文字、圖片、音訊、影片 | Google 模型卡片 |
Gemini 3.7 快閃定價與 API 費用
定價機制需要明確區分「公布費率」與「單一特定答案的成本」。擷取的人工分析摘要顯示: 每 100 萬輸入代幣為 $0.75 和 每 100 萬個輸出代幣為 $3.75 針對所選的 Gemini 3.7 Flash (高) 產品資訊。這些數字為第三方網頁資料,不能取代 Google 的官方定價表,亦不代表所有存取路徑的情況。.
擷取的第三方價格脈絡
僅供參考。這些條形圖並不能取代官方的計費單位、級距、區域或快取/批次規則。.
的 Google 模型卡片 列出了一項 API 入門費率為 每 100 萬輸入代幣為 $0.75,每 100 萬輸出代幣為 $3.75 此費率適用於兩款 Flash 機型,有效期至 2026 年 12 月 31 日。下文所列的每張卡估算值是將該費率套用至已記錄的代幣;其中不包含重試、快取、稅金及路線特定費用。.
| 成本項目 | Gemini 3.7 Flash | Gemini 3.6 閃光燈 | 證據範圍 |
|---|---|---|---|
| 初步輸入價格 | $0.75 / 1M | $0.75 / 1M | Google 型號卡;有效期至 2026 年 12 月 31 日 |
| 初步出廠價格 | $3.75 / 1M | $3.75 / 1M | 不同航線的計費方式可能有所不同 |
| 六組已完成的測試對 | 關於 $0.0303 | 關於 $0.0382 | 源自已記錄的代幣;不包含 T01 |
Gemini 3.7 Flash 官方基準測試
官方基準測試旨在回答一個狹義的問題:該模型在已發表的評估中,於該評估的設定下表現如何。這些基準測試雖能提供有用的背景資訊,但並不能取代本評測中針對相同提示所進行的輸出比較。.
編碼、代理與推理基準測試
Google 的型號資料卡和官方文件是驗證 Google 自身效能基準聲稱的依據。最終版本將針對每個數值,明確列出其衡量指標、日期、機型變體、對比機型以及測試設定。若某項數值為 3.7,且是與舊款機型進行比較,則不會僅以「3.7 對比 3.6」的方式含糊呈現。.

基準測試的表現提升無法證明什麼
- 較高的編碼分數並不能證明每個儲存庫的首次修補程式都更為乾淨。.
- 推理分數並不能證明某人的 SEO 編輯能力或截圖解讀能力較佳。.
- 第三方智慧指標並不能取代本綜述中針對特定任務所提出的證據。.
- 不應將重疊的不確定性或不同的測試設定,視為決定排名的依據。.

我們如何測試 Gemini 3.7 Flash
這是一項配對式 API 測試,而非一組互不相關的示範。 兩款模型均採用相同的提示、原始素材、溫度參數 0、輸出代幣上限,以及呈現方式。T05 的評分是根據兩次初次嘗試均觸及較低上限後,共同進行的 5,000 代幣重跑結果得出的。T01 即使經過相同的重跑,兩款模型的結果仍未完成。.
| 記錄欄位 | 為何重要 |
|---|---|
| 模型 ID 與回傳的模型 ID | 確認所請求的模型即為回應的模型。. |
| 已過去的秒數 | 測量同一路徑下的端對端響應時間。. |
| 輸入與輸出標記 | 支持一份相近的成本估算。. |
| 格式符合性 | 區分正確答案與仍需修正結構的答案。. |
| 編輯品質 | 檢查正確性、完整性、具體性、呈現方式及聲稱的安全性。. |
若某個已處理的請求沒有可用的輸出結果,則會被視為執行問題,且不會被計入品質損失。.
Gemini 3.7 快閃記憶體實際測試結果
每張卡片均顯示實際的任務輸入、每則已儲存回覆的忠實節錄,以及根據完成作品所做出的評斷。耗時為端到端時間。費用則採用上文所述的 Google 入門費率。.
測驗 1 — 研究綜述
任務輸入: 請僅根據提供的四項事實,撰寫一篇 180 字的買入建議,內容須包含一項建議、三項理由、兩項未知因素,以及一項測試計畫。.
Gemini 3.7 Flash
33.427 秒 · 85 個輸入 / 4,996 個輸出標記 · 預估 $0.01880
第二次配對運算在達到 5,000 代幣的上限後停止,隨後產生了一則可用的 180 字推薦內容。.
Gemini 3.6 閃光燈
28.706 秒 · 85 個輸入 / 4,996 個輸出標記 · 估計 $0.01880
它回傳了相同的完成標記計數,以及相同的 長度 完成原因。.
輸出結果顯示了什麼
這兩款模型首先達到 2,400 個代幣,隨後在 5,000 個代幣時重複了該行為。不完整的文字不會被視為品質的依據。.
測試 2 — 程式錯誤修正
任務輸入: 修復 top_paid(records) 回傳三筆數值最高的已付費記錄,在數值相同時保留輸入順序,保留簽名,處理空輸入,說明原因,並新增兩項測試。.
Gemini 3.7 Flash
11.379 秒 · 90 個輸入 / 1,431 個輸出令牌 · 估計 $0.00543
paid.sort(key=lambda r: r["amount"], reverse=True); return paid[:3]該分析將「升序排序」確定為問題原因,並針對篩選、排序、並列情況及空輸入進行了測試。.
Gemini 3.6 閃光燈
13.984 秒 · 90 個輸入標記 / 2,273 個輸出標記 · 預估 $0.00859
paid.sort(key=lambda r: r["amount"], reverse=True); return paid[:3]它產出了同樣正確的修補程式,並涵蓋了相同的驗收標準,只是回應內容較長。.
輸出結果顯示了什麼
兩者都正確地利用 Python 的穩定排序來處理數值相等的情況。3.7 版的解法較為簡短,但最終的程式碼與程式碼覆蓋率是等效的。.
測試 3 — 文字型前端實作計畫
任務輸入: 針對所述的兩欄式結帳頁面,規劃修正方案,包括:多餘的空白、層級結構薄弱、「立即付款」標籤過小、可視度低的信任聲明、折扣警告、總額顯示,以及行動裝置上的元素堆疊問題。. 未提供螢幕截圖。.
Gemini 3.7 Flash
15.009 秒 · 86 個輸入 / 1,591 個輸出標記 · 估計 $0.00603
該提案建議採用 58/42 的網格布局、48–56 像素的行動呼籲按鈕(CTA)、鄰近的信任標章、琥珀色的警示標示、行動裝置堆疊佈局、焦點狀態,以及 44 像素的觸控目標。.
Gemini 3.6 閃光燈
15.254 秒 · 86 個輸入 / 1,767 個輸出標記 · 估計 $0.00669
其結果呈現出一致的 60/40 佈局、明確的字型大小、48–52px 的行動呼籲按鈕(CTA)、有序的右側欄內容、斷點設定,以及無障礙檢查。.
輸出結果顯示了什麼
兩者皆可修正。3.7 版的答案寫著「點擊可負擔性(click affordability)」,顯然是想說「可操作性(affordance)」,並將非對稱網格稱為「對稱」。3.6 版則只需稍作修改。.
測試 4 — 狀態感知式提取
任務輸入: 請用 120 字概述關於 Orion 的九項事實,並附上一張表格,同時保留「已確認」、「已規劃」、「待定」、「未知」及「未經證實」等狀態。.
Gemini 3.7 Flash
13.681 秒 · 117 個輸入 / 1,064 個輸出標記 · 估計 $0.00408
針對以圖像為主的 18%,該報告維持「結果未知」的說法;但將 82% 的試行結果描述為「成功」,並將第二項試行標註為「已確認/已規劃」。“
Gemini 3.6 閃光燈
9.270 秒 · 117 個輸入 / 1,454 個輸出標記 · 估計 $0.00554
該文件中立地描述該試行計畫處理了 82% 件案件,並將第二項試行計畫標示為「已核准(法律程序待定)」。“
輸出結果顯示了什麼
兩者均保留了所有重要事實。Gemini 3.6 版 Flash 對「已核准」、「待定」及「未知」狀態的描述更為精確,而 3.7 版則對首個試飛的描述略顯誇大。.
測驗 5 — 數據推理
任務輸入: 根據四個管道的支出、點擊數、付費轉化次數及營收數據,進行算術運算,對可量化的 ROAS 和轉化率進行排名,將零支出視為無法量化,並建議採用「$300」的條件式分配比例。.
Gemini 3.7 Flash
16.540 秒 · 137 個輸入標記 / 1,981 個輸出標記 · 估計 $0.00753
ROAS:電子郵件 7.00×、搜尋 3.00×、社群媒體 2.60×;合作夥伴無法衡量。轉換:電子郵件 12.5%、搜尋與合作夥伴 10%、社群媒體 5%。此活動提供了三種條件分組。.
Gemini 3.6 閃光燈
18.096 秒 · 137 個輸入 / 2,403 個輸出令牌 · 預估 $0.00911
它產生了相同的排名和邊界情況處理方式,隨後提供了效率、多元化以及「合夥人測試」的分配方案。.
輸出結果顯示了什麼
這兩種計算方式都正確,且兩者都使該建議具有條件性。兩者皆針對「Partner」的零支出增添了推測性的背景說明,因此該句需要來源佐證,否則應予以刪除。.
測試 6 — 主體性規劃與工具使用
任務輸入: 請僅使用四種已命名的工具,擬定一份不超過 220 字的計畫。若該頁面無法存取、非官方或內容含糊不清,請停止操作,且切勿聲稱已執行相關工具。.
Gemini 3.7 Flash
10.787 秒 · 100 個輸入 / 1,174 個輸出標記 · 估計 $0.00448
其四個步驟與提供的工具一一對應,隨後分別經過「官方領域」、「可用性」及「清晰度」三道審核關卡。完成此流程需精確地有一筆經過驗證的 CSV 記錄。.
Gemini 3.6 閃光燈
9.702 秒 · 100 個輸入標記 / 1,328 個輸出標記 · 估計 $0.00506
該方案雖可行,但新增了「或解析 HTML 主體」這項操作,而此操作並不在提供的工具清單之中。.
輸出結果顯示了什麼
兩者皆遵循「官方來源停止規則」,並避免假裝工具已被執行。3.7 方案則更嚴格地受限於可用函式範圍內。.
測驗 7 — SEO 寫作與編輯
任務輸入: 請僅回傳包含一個段落和一個簡短清單的 HTML 內容,精確使用該關鍵字一次,並保留四個已鎖定的事實,切勿杜撰任何結果、價格、發行日期或供應狀況的聲明。.
Gemini 3.7 Flash
7.263 秒 · 125 個輸入標記 / 707 個輸出標記 · 估計 $0.00275
<p>在這篇即將發布的 Gemini 3.7 Flash 評測中,我們將透過比較官方基準測試結果與採用相同提示的 API 測試結果,來分析 Google 的這款模型;實際測試結果目前尚待公布。.</p>它遵循了 HTML 的結構,僅使用一次該關鍵字,並保留了已鎖定的聲明。.
Gemini 3.6 閃光燈
7.542 秒 · 125 個輸入標記 / 833 個輸出標記 · 估計 $0.00322
<p>這篇關於 Gemini 3.7 Flash 的初步評測,針對 Google 的新機型進行了評估……不過詳細的實機測試結果目前尚未出爐。.</p>結構是正確的,但「新模型」增添了一項超出既定事實範圍的主張。.
輸出結果顯示了什麼
關鍵的差異在於安全性聲明:版本 3.7 拒絕新增該未受支援的描述符,同時仍能回傳有效的緊湊型 HTML。.
Gemini 3.7 閃存測試評分表與重點摘要
就最終輸出品質而言,Gemini 3.7 Flash 在比較中表現較佳,但其優勢主要來自指令紀律,而非顯著的能力差距。Gemini 3.6 Flash 在程式碼和算術方面仍具競爭力,且生成了更優的前端計畫。.
配對測驗評分表
| 度量 | Gemini 3.7 Flash | Gemini 3.6 閃光燈 |
|---|---|---|
| 任務勝利 | 3 | 2 |
| 優質領帶 | 1 | 1 |
| 結果不明確的任務 | 1 | 1 |
| 可用的已完成任務 | 第 6 頁,共 7 頁 | 第 6 頁,共 7 頁 |
| 已完成任務的輸出標記 | 7,948 | 10,058 |
| 最佳觀測結果 | 有界能動性計畫 | 文字前端計畫 |
Gemini 3.7 閃存限制
觀察到的最大限制是兩者皆相同:針對一項僅含 180 個單字的簡單研究綜述請求,這兩種模型都將輸出預算耗盡了兩次。在測試的配置下,T01 無法使用。.
Gemini 3.7 Flash 的表現並非全面優異。其前端方案存在措辭錯誤,且內部佈局與描述不符;此外,兩份數據答案均針對「零支出通道」提出了推測性情境。 由於該套題僅使用文字輸入,因此無法驗證其圖像、音訊、影片或真正長語境方面的品質。.
Gemini 3.7 快閃版值得入手嗎?
是的,當精確的指令遵循性至關重要時,Gemini 3.7 Flash 確實值得進行測試。. 在六組可用的配對中,該系統贏得了三項已完成的任務,且輸出標記的使用量較少。至於簡單的程式碼修正、算術運算或使用者介面規劃等情境,其優勢則不那麼明顯,在這些情境中,Gemini 3.6 Flash 贏得了前端任務,或表現得不相上下。.
您可以在以下位置執行相同的指令提示: GlobalGPT 並將其與同一工作區中的 Gemini 3.6 Flash 進行比較。請以您的定期任務作為決定性測試。.
Gemini 3.7 閃存評測:最終評斷
這篇關於 Gemini 3.7 Flash 的評測以一個差距雖小但仍具說服力的結果作結: Gemini 3.7 Flash 贏得三項已完成的任務,Gemini 3.6 Flash 贏得兩項,其餘一項則為平手。. 其中一項研究任務未能得出明確結論,因為兩款模型都曾兩次達到共同的輸出上限。.
Gemini 3.6 Flash 並未過時。它產出了更優異的文本前端規劃與更精確的狀態表,而 3.7 則在編碼、數據推理以及鎖定事實的 SEO 編輯方面更為強勢。在代理式規劃任務方面兩者不分上下,因此此次升級屬選擇性而非絕對性的。.
Gemini 3.7 Flash 常見問題集
Gemini 3.7 Flash 是何時發行的?
Google 將 Gemini 3.7 Flash 列為穩定型號,其型號文件最後更新於 2026 年 8 月 13 日。.
Gemini 3.7 Flash 版本是穩定版還是預覽版?
在 Google 的 Gemini API 模型文件中,此功能被標示為「穩定」。但 AI Studio、Gemini 消費級產品以及第三方路由仍可能顯示不同的可用性或配額。.
Gemini 3.7 Flash API 的型號編號是什麼?
所要求的比對使用的是 `gemini-3.7-flash`,但在最終文章將其標示為「已驗證」之前,必須先從 API 回應中記錄下回傳的模型 ID。.
Gemini 3.7 Flash 的價格是多少?
截至 2026 年 12 月 31 日,Google 的付費級費率為每 100 萬輸入代幣 $0.75,每 100 萬輸出代幣 $3.75; 自 2027 年 1 月 1 日起,所列費率將調整為 $1.50/$7.50。.
Gemini 3.7 是否無 Flash?
消費者或第三方可取得服務,並不代表可無限次免費存取 API。請確認您計畫使用的存取方式所對應的路徑、配額、速率限制及計費條款。.
什麼是 Gemini 3.7 Flash 上下文視窗?
擷取的「人工分析」摘要顯示了一份 100 萬個標記的上下文清單。請參閱 Google 的文件,以確認確切的官方上下文限制,以及任何關於長上下文的定價或功能限制。.
Gemini 3.7 Flash 是否支援圖片、音訊、影片及 PDF 檔案?
請確認該特定 API 模型 ID 所支援的輸入類型。本次審查將把每種受支援的模態視為已記錄的功能,而非證明所有輸入類型皆具備同等品質。.
什麼是 Gemini 3.7 閃思層級?
Gemini 3.7 Flash 配備了可自訂的智慧控制功能。具體的級別、預設值、代幣行為及計費影響,請參閱官方 API 文件。.
Gemini 3.7 Flash 是否比 Gemini 3.6 Flash 更好?
在這項匹配的 API 測試中,Gemini 3.7 Flash 在三項已完成的任務中勝出,Gemini 3.6 Flash 則贏得兩項,其中一項打平,另一項結果無法判定。這顯示 3.7 版本僅擁有微弱優勢,而非全面勝出。.
Gemini 3.7 Flash 是否比 Gemini 3.1 Pro 更好?
本草案並未提出此項主張。Gemini 3.1 Pro 屬於不同的比較基準,因此需要其專屬的匹配提示集與證據,而非從 Gemini 3.6 Flash 比較中推論得出。.
Gemini 3.7 Flash 適合編碼嗎?
是的,在這裡測試的這個狹義的錯誤修復任務中,兩種模型都生成了正確的最小修補程式,但 Gemini 3.7 Flash 因測試覆蓋率更完整且完成的標記較少,略勝一籌。.
Gemini 3.7 Flash 能否使用工具並執行代理程式工作流程?
請參閱官方工具及函式呼叫文件,以了解確切的執行路徑。本評測中的代理式測試旨在評估規劃能力與邊界感知能力;並未聲稱僅憑規劃本身即可證明工具執行成功。.
我該去哪裡取得 Gemini 3.7 韌體?
如有 Google 官方的存取點,請優先使用;若無,請嘗試 GlobalGPT 型號頁面 當該模型在您的帳戶和所在地區啟用時。.
官方基準測試的結果與實際使用情況相符嗎?
並非自動如此。官方基準測試與第三方評估提供了有用的背景資訊,而相同提示的測試則展現了模型如何處理正在被測量的特定任務。本評測將這類證據分開處理。.



