若需進行本地、離線或自訂部署,請選擇 Gemma 4。若需進行受管研究、長篇文件分析,以及存取 Google 的圖像與影片工具,請選擇 Gemini。. 最大的差異在於,您希望自行管理系統的哪些部分。.
- 珍瑪 4: 可下載字重;五種字體大小;128K–256K 字庫範圍;文字輸出。.
- 雙子座 託管模型;在此比較之模型中,輸入標記數量最高可達 100 萬;管理型工具及獨立的媒體模型。.
- 兩者都使用: 將敏感資料的萃取作業保留在本地端,然後將經核准的內容傳送至雲端,以供研究或生產之用。.
的 Gemma 4 模特兒資料卡 定義了本地的模型系列。若要使用受管理的起點,請嘗試 Gemini 3.1 Pro 運行於 GlobalGPT 上.
依工作流程選擇
請從您的不可妥協的要求開始。一個範例基準無法決定您的檔案可以存放於何處,或是由誰來維護該系統。.
- 必須能在離線狀態下運作嗎? 在安裝完重量資料與執行時間後,即可執行 Gemma 4。.
- 需要掌控重量、硬體和調校嗎? Gemma 4 讓您掌握這項控制權——並負責相關的操作工作。.
- 想在本週內見到成果,卻不想花太多時間準備嗎? Gemini 大幅減輕了服務與擴展的工作量。.
- 需要成品圖片或影片嗎? 請使用專用的圖像模型,或 Google 託管平台中的 Veo。僅靠文字模型無法產生這些資產。.
若想在同一個地方查看更多機型選擇,, GlobalGPT 提供存取 100 種人工智慧模型, 方案價格自 每月 $10 以下.

Gemma 4 與 Gemini 規格一覽
| 類別 | Gemma 4 | 雙子座 |
|---|---|---|
| 它是什麼 | 來自 Google 的開放重量模型系列 | 來自 Google 的管理式雲端模式和服務生態系統 |
| 如何存取 | 下載權重,並透過支援的執行時間或合作夥伴平台執行 | Gemini API、Google AI Studio、Google AI 計劃、Vertex AI、Gemini 應用程式 |
| 部署方式 | 自託管、邊緣、本地優先、夥伴託管推理 | 由 Google 主持 |
| 離線使用 | 是的,取決於您自己的設定 | 不,意義不同 |
| 上下文視窗 | E2B/E4B 為 128K;12B Unified、31B 及 26B A4B 為 256K | 目前 Gemini 3 開發者機型的代幣最高可達 1M |
| 輸入類型 | 所有版本均包含文字與圖片;E2B、E4B 及 12B Unified 版本則附有原生音訊 | 文字、影像、視訊、音訊、文件和工具中介的工作流程,視機型而定 |
| 輸出類型 | 文本 | 廣義的文字,加上透過 Google 的託管模式堆疊產生的圖片和視訊 |
| 模具 | 在模型層級提供函式呼叫和編碼支援,但協調是您的工作 | 搜尋、URL 上下文、代碼執行、函式呼叫、結構化輸出、媒體 API |
| 隱私權邊界 | 由您的基礎架構和部署選擇決定 | 由 Google 服務層級和條款決定 |
| 成本模式 | 模型下載加上硬體、儲存、調整和作業成本 | 以代用幣或媒體為基礎的雲端定價,以及免費和付費等級 |
| 最適合 | 本地 AI、私人部署、自訂工作流程、邊緣使用 | 管理研究、長時間內容分析、多模式雲端工作、影像與視訊工作流程 |
| 不適合 | 交鑰匙媒體生成或零操作雲端便利性 | 離線先行或深度自託管控 |
以下是相關比較: Google 的 Gemma 部署文件 以及 Gemini 開發者版本的規格;應用程式訂閱與 API 存取屬於獨立的產品。.

Gemma 4:模型與記憶
Gemma 4 於 2026 年 3 月 31 日正式推出。該 現行型號卡 列出 E2B、E4B、12B Unified、26B A4B 及 31B,均採用 Apache 2.0 授權。這些工具皆可接受文字與圖像,並返回文字。.
| 變體 | 上下文 | 音訊輸入 | 典型職務 |
|---|---|---|---|
| E2B | 128K | 是 | 受限裝置的入口點 |
| E4B | 128K | 是 | 適用於資源受限環境的更強大本地化選項 |
| 12B 統一班 | 256K | 是 | 具備統一多模態輸入的中階方案 |
| 26B A4B | 256K | 沒有 | 專家混合模型;約 40 億個有效參數 |
| 31B | 256K | 沒有 | 此系列中最大的高密度模型 |
- 理解: 文件解析、OCR、手寫辨識、圖表、介面、程式設計及函式呼叫。.
- 音訊/視訊的界限: 該型號的資料卡可記錄長達 30 秒的音訊及 60 秒的影片,幀率為每秒一幀。訓練資料截止日期:2025 年 1 月。.
- 12B 統一版: 將圖像片段和音訊波形直接投射至語言模型中,無需額外的編碼器。.
- 部署: 執行環境包括 Hugging Face、Ollama、vLLM、llama.cpp、MLX 以及 LM Studio。請選擇能支援您所選模型與硬體的執行環境。.
| 變體 | BF16 記憶體 | SFP8 記憶體 | Q4_0 記憶體 |
|---|---|---|---|
| E2B | 11.4 GB | 5.7 GB | 2.9 GB |
| E4B | 17.9 GB | 8.9 GB | 4.5 GB |
| 12B 統一班 | 26.7 GB | 13.4 GB | 6.7 GB |
| 26B A4B | 57.7 GB | 28.8 GB | 14.4 GB |
| 31B | 69.9 GB | 34.9 GB | 17.5 GB |
Gemma 4:載入模型所需的記憶體
Q4_0(4 位元)的估計值。柱狀圖越小,表示模型的載入佔用空間越小。.
E2B · 2.9 GB
E4B · 4.5 GB
12B 統一班 · 6.7 GB
26B A4B · 14.4 GB
31B · 17.5 GB
範圍:0–20 GB。來源: Google 的 Gemma 記憶體表. 這些是載入估算值,並非完整的應用程式記憶體需求。.
Google 的表格中列出了 20% 的載入開銷。請為上下文快取、執行時環境及並行處理預留額外空間;若要進行微調,則需要更多記憶體。儘管每個令牌僅有部分權重處於活躍狀態,但 26B A4B 模型仍會載入所有專家權重。.
Gemma 4 基於 Gemini 3 的研究成果,提供消費級 GPU、本地伺服器及行動裝置等部署途徑。Google 的 Android AICore 開發者預覽版及其下一代 Gemini Nano 計畫,詳見其 Gemma 4 概覽.
關於另一個開放重量級家族,請將其部署預期與我們的 Kimi K3 評測.
哪一款 Gemini 型號適合?
根據工作需求選擇合適的型號。較高的 Flash 版本號並不能取代 Pro 系列。該 Gemini 型號目錄 將推理模型、圖像模型和影片模型分開。.
| 型號或產品 | 用於 | 存取邊界 |
|---|---|---|
| 雙子星 3.1 預覽 | 複雜推理、編碼與多模態分析 | 託管文字輸出 |
| Gemini 3.8 Flash | 代理工作流程與一般生產任務 | 託管文字輸出 |
| Gemini 3.5 Flash-Lite | 大量翻譯與簡易處理 | 託管文字輸出 |
| Nano Banana Pro / Nano Banana 2 | 圖像生成與編輯 | 專用影像模型 |
| Veo 3.1 | 影片生成 | 將影片模型與計費系統分離 |
- Gemini 應用程式 + Google AI 方案: 使用者存取權限與應用程式權限。.
- Google AI Studio: 開發者原型製作。.
- Gemini API: 應用程式與開發者計費系統的整合。.
- 頂點人工智慧: Google Cloud 的部署與企業級管控;請確認其可用性及相關條款。.
有關應用程式存取權限,請參閱我們的 Gemini Pro 免費使用指南.
掌控與便利性

| 您須負責…… | 自行架設的 Gemma 4 | 雙子座 API |
|---|---|---|
| 服務與擴展 | 硬體、執行環境、容量與更新 | Google 負責模型部署 |
| 工具與檢索 | 建立並維繫人際關係 | 在支援的情況下,可使用內建工具;設定您的工作流程 |
| 可靠性 | 監控、備用方案、吞吐量與量化 | 處理 API 錯誤、配額、重試及預算 |
| 資料與安全性 | 存取控制、日誌及本地工具的運作行為 | 選擇服務層級並設定安全資料處理方式 |
Gemma 讓您擁有更大的掌控權。Gemini 則能節省設定時間。但兩者仍需有人負責確保應用程式的可靠性與輸出品質。.
背景與媒體支援
| 能力 | Gemma 4 | Gemini 開發者技術堆疊 |
|---|---|---|
| 輸入上下文 | 128K:E2B/E4B;256K:12B/26B/31B | 在 3.1 Pro、3.8 Flash 及 3.5 Flash-Lite 上共有 1,048,576 個輸入標記 |
| 文字輸出 | 是的;資料擷取、摘要、程式碼及結構化資料 | 是的;這三個模型的輸出代幣數量最多可達 65,536 個 |
| 視覺理解 | 圖片、文件、圖表、螢幕截圖及影片片段 | 圖片、影片及 PDF 檔案;針對特定型號的工具 |
| 聽力理解 | E2B、E4B 與 12B 統一版 | 由上述三種模型提供支援 |
| 圖像/影片生成 | 非原生輸出 | 專用的圖像模型與 Veo;並非 Pro/Flash 文字模型的輸出結果 |
限制源自於 Gemma 模特兒資料卡 以及 Gemini 的個別模型規格。較大的上下文視窗並不能保證答案更準確。.
- Gemma 的交付成果: 發票 JSON 檔案、簡報摘要、翻譯後的演講稿、螢幕截圖中的待辦事項以及研究大綱。.
- Gemini 文件處理: 原生 PDF 解析能力,包括圖表與表格;最大支援 50 MB 或 1,000 頁,但合併後的輸入內容仍受模型上下文限制。.
- 媒體製作: 在擬定簡報大綱後,請使用另一張圖片或影片範本。.
關於檔案和頁面的限制,請參閱 Google 的 PDF 文件.
隱私權:比較服務層級
| 設定 | 資料會怎麼樣? | 應檢查的事項 |
|---|---|---|
| 自行架設的 Gemma 4 | 推論可維持在您所控制的硬體上 | 遠端工具、遙測、日誌、權限與備份 |
| Gemini API 未付費服務 | 使用者提供的資料和回饋可能有助於改善 Google 產品;系統可能會進行人工審查 | 請勿根據這些條款提交敏感資料;部分地區可能有例外情況 |
| Gemini API 付費服務 | 提示詞和回應不會用於改善 Google 產品 | 安全/保安日誌記錄仍受限制,且法律規定的披露義務依然適用 |
| 歐洲經濟區、瑞士及英國 | 付費服務的數據使用條款亦適用於這些地區的免費服務 | 此處提供給使用者的 API 客戶端必須使用付費服務 |
此區別源於 Gemini API 條款. 即使 AI Studio 本身的存取權限是免費的,只要透過一個已啟用且與計費系統連結的雲端專案,或一個 Workspace 企業帳戶,即可將 AI Studio 視為付費服務。.
- 「本地」並不等同於「符合規定」: 您的部署與存取控制定義了隱私權的邊界。.
- 付費並不代表留存率為零: 檢視記錄、處理地點以及貴組織的要求。.
- 區域支援是獨立的: 檢查 支援 Gemini API 區域 以及必要時相關的 Vertex AI 路徑。.
出版權則是另一個問題;請參閱 Gemini 圖片商業使用指南.
成本:本地硬體與 API 的比較
| 成本項目 | Gemma 4 自行架設 | 雙子座 API |
|---|---|---|
| 模型的使用 | 可下載的權重;本地推論無需 Google 代幣費用 | 將依所選方案的費率計費 |
| 基礎建設 | 硬體、記憶體、儲存、電源與伺服器 | Google 負責提供服務 |
| 營運 | 設定、調校、監控與維護 | 整合、重試、預算控制與輸出審查 |
| 額外功能 | 建立或串接您自己的服務 | 工具、快取/儲存、圖片及影片費用可能另計 |
對於小型或偶發性的工作負載,使用 API 的成本可能比建立本地端架構所花費的時間更低。對於穩定的工作負載,自行架設可能較為合適,但這取決於資源利用率與營運成本。.
| 標準 API 模型 | 輸入 / 100 萬個代幣 | 產出 / 100萬個代幣 |
|---|---|---|
| 雙子星 3.1 預覽 | ≤200K 提示詞:$2;>200K:$4 | ≤200K 提示詞:$12;>200K:$18 |
| Gemini 3.8 Flash | 截至 2026 年 12 月 31 日:$0.75;之後為 $1.50 | 截至 2026 年 12 月 31 日:$3.75;此後為 $7.50 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
100 項文字任務的費用是多少?
每次呼叫:10,000 個輸入代幣 + 1,000 個計費輸出代幣。總計:100 萬個輸入代幣 + 10 萬個輸出代幣。.
雙子星 3.1 預覽 · $3.20
Gemini 3.8 Flash · $1.125(約 $1.13)
Gemini 3.5 Flash-Lite · $0.55
評分範圍:0–4 美元。根據以下內容計算: Google 標準 API 費率; 這是一個成本範例,並非測試結果。.
- 計算: 輸入速率 × 1 + 輸出速率 × 0.1。每項請求均低於 Pro 方案的 200K 門檻。.
- 輸出內容包含思考代幣。. 1,000 個代幣的配額是指完整的可計費產出,而不僅僅是可見的答案。.
- 不包括: 工具、快取/儲存、重試、稅金以及圖片/影片生成。不適用批量折扣。.
- 限時優惠: $1.125 適用至 2026 年 12 月 31 日。根據 2027 年 1 月 1 日的費率,相同的工作量對應的費率為 $2.25。.
- 分開購買: Google AI 應用方案、Gemini API 使用量及 GlobalGPT 訂閱方案的計費方式與使用權限各不相同。.
Veo 的計費方式是根據生成的影片長度以及所選的方案/解析度而定。影像生成亦採用不同的費率;請比較 Nano Banana 2 配額與 API 費用.
如何解讀基準測試結果
利用基準測試篩選出候選模型,然後針對您實際需要的任務進行測試。基於工具的託管系統與本機量化模型屬於不同的評估架構。.
- 珍瑪 4: the 官方模型卡 報告中呈現了推理、編碼及多模態的測試結果,包括 MMLU-Pro、AIME 2026、LiveCodeBench、GPQA Diamond、MMMU-Pro 以及 MATH-Vision。.
- Gemini 3.1 Pro: Google的 Pro 基準測試頁面 涵蓋艱深的科學、程式設計及代理任務。透過搜尋或程式碼工具所獲得的結果,亦可作為評估工具輔助系統的指標。.
- 公平比較: 在呼叫某個模型之前,應先確保模型版本、提示詞、工具、預算設定及推理設定均已匹配。.
| 基準表格能告訴您什麼 | 他們無法告訴您的事 |
|---|---|
| 開放重量模型族是否正在縮小難度推理和多模態任務的差距 | 對您的團隊來說,是否更便宜或更容易部署 |
| 托管前沿模型在困難的編碼、科學或代理任務上是否具有更強的性能 | 這項優勢是否能在您特定的延遲、隱私權或預算限制下維持不變 |
| 模型族是否強大到足以考慮在當地使用 | 在您的確切提示和工具工作流程中,它是否會優於其他機型 |
| 長內容和多模式支援是否不只是行銷宣稱 | 輸出品質是否符合您的教室、研究或創意標準 |
在您自行進行測試時,請記錄答案品質、延遲時間及總營運成本。公開的分數並不能決定哪種部署方式對您的團隊來說更經濟或更可靠。.
文件、程式碼與媒體

| 約伯 | Gemma 4 方法 | Gemini 方法 |
|---|---|---|
| 文件 | 渲染頁面或動態內容圖片;建立本地化擷取/OCR 功能及結構化輸出 | 針對混合版面配置、圖表及表格,運用原生 PDF 解析功能 |
| 研究 | 連接您自己的檢索、瀏覽和驗證工具 | 利用受支援的「搜尋錨點」、「URL 上下文」及「程式碼執行」功能 |
| 編碼 | 將模型整合至內部工具及受控的沙箱環境中 | 運用引導式推理及輔助工具進行多步驟編碼 |
| 圖像 | 彙整需求、分類資產並撰寫簡報 | 使用 Nano Banana 影像模型進行生成或編輯 |
| 影片 | 分析選取的畫面;製作分鏡腳本與鏡頭清單 | 使用 Veo 生成實際影片 |
若要了解另一種文件工作流程,請比較我們的 ChatGPT PDF 工作流程.
十個實用案例
| 真實工作流程 | 更適合 | 為何 |
|---|---|---|
| 學校筆記型電腦上的離線教室助理 | Gemma 4 | 本地部署和離線執行比託管媒體工具更重要 |
| 在受控環境內的私人合約提取 | Gemma 4 | 資料邊界可留在您的基礎架構內 |
| 分析 500 頁的研究資料包 | 雙子座 | 1M 上下文和本機 PDF 理解能力可減少管道摩擦 |
| 以搜尋為基礎的競爭研究 | 雙子座 | 搜尋、URL 上下文和工具使用內建於託管堆疊中 |
| 本地截圖理解和 UI 分流 | Gemma 4 | 視覺加上文字輸出就足夠了,本地使用可以更簡單 |
| 行銷影像產生與編輯 | Gemini 圖像模型 | 官方支援主機影像產生與編輯 |
| 腳本到完成視訊的工作流程 | 雙子座 | Gemini API 堆疊中的 Veo 涵蓋直接視訊輸出 |
| 自訂內部環境的編碼助手 | Gemma 4 | 當模型控制和自寄存重要時,擬合效果更佳 |
| 大規模低成本大量總結 | Gemini Flash 或 Flash-Lite,或 Gemma 4,視行動成熟度而定 | 對小型團隊來說,託管定價可能較便宜,但在規模上,自行託管可能會勝出 |
| 移動和邊緣推理實驗 | Gemma 4 | Google 明確地將 Gemma 4 定位為消費者 GPU、本機優先伺服器和 Android 通路。 |
- 同學們與老師們: 就本地學習指南、講義簡報摘要及離線課堂輔助工具而言,Gemma 更為合適;至於長篇論文與簡報素材,則更適合使用 Gemini 所提供的託管工具。.
- 研究人員: 在必要時將私有語料庫保留在本地;若資料政策允許,則在大型文件合成及基於網路的研究中使用 Gemini。.
- 行銷人員與內容創作者: 潔瑪負責整理企劃書與素材;專職的媒體模特兒則會將工作進行到底,直至完成最終的影像或影片。.
在影片階段,請使用 Veo 3.1 使用指南.
兩個值得嘗試的提示
Gemma 4:私人發票擷取。. 此工作流程會將原始檔案保留在本地端,並產生結構化文字。.
您正在讀取同一個供應商資料夾中的一批發票頁面和截圖。
對於每個頁面
1.擷取發票號碼、發票日期、到期日、明細項目、小計、稅項和總計。
2.標記可信度低的欄位。
3.如果數值只出現在影像區域,請註明。
4.僅傳回有效的 JSON。.
- 輸入: 發票頁面及螢幕截圖。.
- 輸出: JSON,包含低可信度標記。.
- 您的工作: 在將資料傳送至另一套系統之前,先對各欄位及總計進行驗證。.
Gemini:一份從報告到活動的工作流程。. 運用文件解析與 URL 工具,然後將生成的簡報轉交給適當的媒體模型。.
閱讀這份 300 頁的市場報告和連結的公司網頁。
總結對美國 SaaS 團隊而言最重要的五個轉變。
針對每個轉變,提供
- 簡明的英文解釋
- 一個有證據支持的引文或數據點
- 一個產品影響
- 一個行銷影響
然後將摘要變成
- 六張簡報大綱
- 社交圖形簡介
- 45 秒視訊腳本
- 輸入: 一份 300 頁的報告及公司簡介頁面。.
- 輸出: 以證據為依據的分析、簡報大綱、圖片說明及影片腳本。.
- 下一步: 生成圖片或影片需要另行呼叫模型;此提示語會產生相關方案。.
在影像處理步驟中,請繼續進行 Nano Banana Pro 提示指南.
何時應同時使用這兩者

- 支持在地: 敏感資訊萃取、螢幕截圖篩選、機密文件分類及邊緣推論。.
- 檢視交接流程: 在資料離開本地環境之前,對其進行審核或刪減。.
- 上傳至雲端: 長篇文件綜合整理、當前網路研究與媒體製作。.
- 依交付成果選擇: 一位創辦人可能會使用本地版 Gemma 進行私下分析,使用 Gemini 進行合成,並使用另一個模型來編輯品牌語調。.
GlobalGPT 的產品目錄包含 Gemini 3.1 Pro、Gemini 3.8 Flash、Nano Banana Pro、Nano Banana 2 及 Veo 3.1,以及非 Google 機型。 整合式工作區可減少在研究、撰寫、圖片和影片之間切換分頁的次數。.
應避免的五個錯誤
- “「下載權重即意味著免費生產。」” 請將硬體、記憶體、電源、工程及維護等項目一併計算在內。.
- “「所有 Gemini 層級處理資料的方式都相同。」” 請比較實際的服務條款及各地區的適用條件。.
- “「多模態是指圖像和影片的生成。」” Gemma 能理解視覺輸入,但會輸出文字。.
- “「雲端技術將取代所有本地端的使用情境。」” 離線執行與自行託管仍需一個本機部署路徑。.
- “「標準最高者勝出。」” 您的提示、工具、延遲目標和資料邊界都可能影響實際結果。.
您應該選擇哪一個?

| 請選擇…… | 當這些是你的優先事項時 |
|---|---|
| Gemma 4 | 離線存取;權重與執行時間控制;敏感資料的本地擷取;邊緣部署 |
| 雙子座 | 較少的服務工作;長篇文件;受管制的工具;可存取獨立的圖像與影片模型 |
| 兩者 | 先在本地進行私有預處理,隨後進行經核准的雲端研究或生產 |
Gemma 4 讓您掌握控制權。Gemini 為您提供一個受管平台。. 請選購符合您工作負載,且符合您團隊所能維持之運作力度的配置方案。.
在您確定之前
- 定義輸出: text/JSON、一張圖片、一段影片,或是另一項工具中的操作。.
- 設定資料邊界: 哪些輸入資料可能會離開您的環境?
- 估算工作量: 請求、代幣、並發性及所需的正常運作時間。.
- 請指出此運算子的名稱: 誰負責管理本地端服務或雲端服務的預算,以及處理相關的故障?
- 試試一項具代表性的任務: 在進行擴展之前,請先評估品質、延遲及總成本。.
常見問題
Gemma 4 可以離線運行嗎?
是的,只要有已下載的權重和合適的本地執行環境即可。外部搜尋、遠端工具及模型下載仍需各自的連線能力。.
哪些 Gemma 4 型號支援音訊?
E2B、E4B 和 12B Unified 皆可處理音訊。這五種規格均可處理文字與圖片,並能生成文字;但它們並非原生的圖片或影片生成器。.
Gemma 4 的價格是否比 Gemini 更便宜?
這取決於使用方式和基礎架構。本地權重會將成本轉嫁至硬體和營運;Gemini 則會針對 API 使用量及任何額外工具進行計費。.
Gemini 訂閱方案是否包含 API 配額?
Google AI 消費者方案與 Gemini API 計費屬獨立購買項目。請參閱您工作流程所適用的特定應用程式授權條款或開發者費率表。.
我可以從 Gemini 到 GlobalGPT 之間使用嗎?
GlobalGPT 除了提供其他模型系列和媒體工具外,還提供 Gemini 模型路線。其計費與控制機制與原生 Google 應用程式及 API 帳戶是分開運作的。.



