DeepSeek V4 Pro 評測:有哪些變化、效能測試、定價以及如何試用

DeepSeek V4 Pro 評測:測試、價格與試用指南
更新於 2026 年 8 月 13 日 獨立實測評測

快速回答: DeepSeek V4 已正式推出,型號分別為 DeepSeek-V4-Pro-0813 和 DeepSeek-V4-Flash-0731。兩者均標示具備 1M 令牌的上下文視窗,以及 384K 的最大輸出量。 Flash 版本是低成本、高並發的選擇;Pro 版本雖然價格較高,但在我們最嚴格的多約束任務中表現更為可靠。.

Pro-0813 Flash-0731 1M 上下文 384K 最大輸出 思考+不思考

DeepSeek V4 Pro 現已推出量產機型,但在 2026 年 8 月的更新後,要在 Pro、Flash 和 Vision-Exp 之間做出選擇已不再那麼直觀。這三款機型雖同屬一個產品系列,但各自側重不同的優先考量:在複雜限制條件下的可靠性、成本與產量,或是影像輸入。.

實際的決策應從工作量著手。對於大量文本且需兼顧預算的自動化作業,Flash 是合適的起點;當不一致的結果會導致昂貴的重做成本時,Pro 則是更合適的選擇。若輸入內容包含圖片,請使用 deepseek-v4-flash-vision-exp 而非任一種純文字模型。.

如果您希望將研究、寫作、推理和程式設計的輔助功能整合於單一工作流程中,您可以存取 GlobalGPT. 此外,還有專用的路線供 DeepSeek V4 Pro. 這是另一種介面選項;官方 API 的計費、限制及整合功能仍屬於 DeepSeek 自身的環境。.

DeepSeek V4 是否已正式發布?

是的。DeepSeek 已於 2026 年 8 月 13 日宣布 V4 Pro 正式上市。官方文件中將該量產型號標示為 DeepSeek-V4-Pro-0813. V4 Flash 顯示為 DeepSeek-V4-Flash-0731, ,而這套於 8 月 21 日推出的實驗性視覺模型則名為 deepseek-v4-flash-vision-exp.

  • V4 Pro: 一款專為更具挑戰性的任務所設計的文本模型。.
  • V4 快訊: 一款針對成本與產量進行優化的文字模型。.
  • V4 Flash Vision-Exp: 一種可接受圖像的實驗性變體。.

廣泛可用並不意味著每項產品或供應商都提供相同的介面、配額或整合功能。有關 API 的決策,請參閱官方 機型與價格 頁面以及該 GA 發行說明.

品質等級

DeepSeek V4 Pro

版本: Pro-0813

最適合: 更複雜的程式設計、代理程式、推理,以及受大量約束條件限制的交付成果。.

效能等級

DeepSeek V4 快閃記憶體

版本: Flash-0731

最適合: 高吞吐量生產、例行編碼、資料檢索,以及對成本敏感的工作負載。.

這些名稱可能會令人混淆,因為 V4 技術報告描述的是預覽版本,而正式上線的 API 則使用的是過期的生產版本。在本篇評測中,除非句子中明確標示「V4 預覽版」,否則「Pro」指 Pro-0813,「Flash」則指 Flash-0731。“

官方定價與規格
DeepSeek V4 Pro 與 Flash 官方版本、上下文限制、功能及 API 定價
DeepSeek API 文件中列出了 V4-Pro-0813 和 V4-Flash-0731,其上下文長度為 1M,並標示了 2026 年 8 月 13 日的代幣價格。價格屬動態變動,發布前應重新確認。.
官方發行紀錄
DeepSeek V4 Flash 7月31日官方更新與代理程式效能測試說明
7 月 31 日的更新記錄了 Flash、效能測試設定以及 Codex 的支援狀況。其中「Pro 版本將於近期推出」的表述是歷史上的發布說明,並非 8 月 13 日的現況。.

DeepSeek V4 Pro 有哪些更新?

最顯著的變化在於規模、情境容量、以代理為導向的介面,以及雙層級產品策略。DeepSeek 的 官方 Pro 系列卡片 該模型是一種專家混合模型,總參數數達 1.6 兆,其中活躍參數為 490 億,並以 MIT 授權條款發佈。隨附的 V4 相關資料闡述了針對實現百萬令牌處理實用性而進行的新型注意力機制與路由機制研究。.

  • 目前共有兩個層級: Pro 適用於對品質要求較高的工作,而 Flash 則適合追求處理量與成本效益的情況。.
  • 工作記憶容量大幅增加: 針對這兩種模型,均列出了 1M 代幣的語境視窗。.
  • 高發電上限: 根據官方規格,輸出代幣數量最高可達 384K。.
  • 代理介面: 工具呼叫、JSON 輸出、回應 API,以及相容於 Anthropic 的存取方式。.
  • 公開級體重: 雖然已提供官方的 V4 型號卡片與檔案,但大規模的本地部署仍是一項重大的基礎設施專案。.

這種組合使 V4 適用於儲存庫級別的編碼、冗長的研究資料包,以及多步驟的代理追蹤。這也改變了競爭框架:如今,有用的評估不僅要考量聊天品質,還需探究模型在工具輔助、嚴格格式及長輸入情境下的表現。我們的 DeepSeek 與 ChatGPT 比較 進一步闡述了這些生態系統在哪些方面有所不同。.

官方人物卡
官方 DeepSeek V4 Pro Hugging Face 模型卡與開放式權重
官方型號卡標示了 DeepSeek-V4-Pro、MIT 授權、1.6T/49B 設計,以及對一百萬個代幣的支援。.

DeepSeek V4 Pro 與 Flash 的比較:實際差異

這兩種版本所呈現的標題上下文和輸出限制皆相同,因此這並非「完整模型與短上下文模型」之間的抉擇。這主要是一項關於品質、價格及容量規劃的決策。 Flash 的官方並發上限是 Pro 的五倍,而 Pro 的快取未命中輸入與輸出代幣成本則略高於三倍。.

規格對照表

Pro 與 Flash 一覽

閃光燈專業
當前版本
閃光燈Flash-0731
專業Pro-0813
上下文視窗
閃光燈100萬枚代幣
專業100萬枚代幣
最大輸出
閃光燈384,000 個代幣
專業384,000 個代幣
思考模式
閃光燈思考與不思考
專業思考與不思考
官方並發上限
閃光燈2,500
專業500
快取未命中次數 / 1M
閃光燈$0.14
專業$0.435
輸出 / 1M
閃光燈$0.28
專業$0.87
我們所觀察到的最大優勢
閃光燈編碼執行速度更快;標記使用量較低
專業完美的嚴格備忘錄得分

官方規格與價格於 2026 年 8 月 13 日確認;實際操作觀察結果均來自每項任務各執行一次,並非官方基準測試。.

較低的成本 + 規模效應

在以下情況下請選擇 Flash……

無論您需要的是低成本的擴展能力、例行性的程式碼修正、資料擷取、分類,還是大量並行請求——您都能藉此驗證高風險的算術運算與格式限制。.

更高的保證

在以下情況下,請選擇「Pro」版本……

該輸出結果結合了法規、政策、財務因素或諸多精確的限制條件,而由此產生的額外成本,遠低於一次細微失誤所造成的代價。.

實作測試:編碼、檢索與遵循約束

我們於 2026 年 8 月 13 日透過同一個相容於 Broly Anywhere OpenAI 的端點,對這兩個 API 模型 ID 進行了測試。 溫度為 0。每個評分結果均代表每個模型與任務各執行一次。實際耗時包含閘道器與上游延遲,因此僅供參考——並非穩定的延遲排名。.

每個模型和任務執行一次

實作評分表

屬觀察數據,非官方數據
行為編碼
8/8 • 8/8

Pro 和 Flash 都通過了所有已修正的測試。.

20.7K 檔案
22/22 • 22/22

兩則答案及所有所需的紀錄引用均正確無誤。.

嚴格備忘錄
12/12 • 8/12

Pro 符合所有規則;Flash 則未符合算術與長度限制。.

測試 1:基於代理的 Python 除錯

該工具集在一個由三個檔案組成的小型 Python 定價專案中,為每個模型提供了四項工具——清單檔案、讀取檔案、寫入檔案以及執行測試。這與在聊天中索取程式碼片段相比,更接近於代理程式的工作流程。.

測驗 1 / 代理編碼

對 Python 定價專案進行除錯、修補及驗證

可編輯且可重複使用——執行前請先檢視輸入內容。.準備複製

這兩款模型都遵循相同的六個呼叫路徑,僅修改了實作方式,並產生了 8 通過. Flash 以 47.378 秒完成此輪測試,而 Pro 則耗時 95.228 秒,且 Flash 使用的回傳代幣數量較少。此輪測試中並無「品質」方面的勝者。如欲了解另一種以程式碼為焦點的觀點,請參閱我們的 DeepSeek 與 ChatGPT Python 程式設計測驗.

實作測試 1 / 代理式編碼
DeepSeek V4 Pro 及 Flash 在代理式 Python 除錯任務中的表現
這兩款機型均在單次執行中通過了 8 項固定測試。計時結果包含閘道器與上行鏈路的延遲,並非官方基準測試。.

測試 2:約 20.7K 令牌的檔案檢索

我們附上了一份檔案,其中包含超過 180 筆紀錄、重複的干擾項、過時的草稿,以及十項零散的事實。該模型必須以精確的十行格式作答,並針對每項答案引用一筆紀錄。.

測試 2 / 檢索

針對一份內容雜亂的資料彙編,提供精確的引用來源

可編輯且可重複使用——執行前請先檢視輸入內容。.準備複製

兩款模型均獲得 22/22 分:十個正確答案、十個正確引用,以及兩分格式分。 Pro 在 10.396 秒內完成此輪測試,Flash 則在 21.737 秒內完成。實際提示字串的使用量約為 20.7K 個令牌。這使其成為一項實用的中長篇檢索測試,但它確實 不是 驗證完整的 1M 代幣視窗。.

實機測試 2 / 檢索
DeepSeek V4 Pro 及 Flash 在 20K 令牌文件檢索任務中的表現
這兩款模型都獲得了 22/22 的分數。實際使用的提示字串約為 20.7K 個標記;這並非一百萬標記的上下文測試。.

測試 3:一份嚴格的發射決策備忘錄

這項任務結合了 120 至 180 字的摘要、一個精確的四行表格、已知風險與未知數量、簡短的決策、有效的 JSON 格式,以及根據財務、法律、工程、銷售、支援和安全部門的備註所進行的第一年成本計算。.

測試 3 / 約束跟隨

編寫一份包含算術運算及嚴格輸出規則的發布備忘錄

可編輯且可重複使用——執行前請先檢視輸入內容。.準備複製

在 2,048 個完成代幣的限制下,兩款模型均將可用的完成預算用於回傳的推理過程,並未產生任何可見的答案。我們保留了這些記錄,隨後以 8,192 個代幣的限制重新執行了未經修改的提示語。 Pro 獲得 12/12 分。Flash 則獲得 8/12 分,因為它回報的數值為 $217,100 而非 $216,900,並將 $200 的錯誤帶入了方差計算中, 且撰寫了 94 字的摘要,而非要求的 120–180 字。.

實作測試 3 / 約束跟隨
DeepSeek V4 Pro 及 Flash 在受限決策備忘錄上的結果
在進行了 2,048 個標記的共同截斷,並以未變更的提示語進行 8,192 個標記的重新執行後,Pro 的得分為 12/12,Flash 的得分為 8/12。.

這個教訓具有特定情境性,而非普世適用:Flash 在編碼和檢索任務上本就表現優異,而 Pro 則在算術、結構與政策限制最為密集的組合情境下更為穩健。若您的工作流程依賴於代理程式外殼,我們的 OpenClaw 與 Claude、Code 與 OpenCode 之比較 有助於將模型與周圍的工具相匹配。.

DeepSeek V4 效能測試:官方數據證實了什麼

最安全的基準來源是 DeepSeek V4 技術報告, ,但其中的表格和圖表所描述的是 V4 Preview 版本。這些資料有助於理解該架構的預期功能與測試設定;它們並非針對過期的 Pro-0813 API 版本所產出的獨立評分。.

證據範圍

預覽分數並非 Pro-0813 分數

官方報告
V4 預覽

來自 DeepSeek 的架構與基準測試數據。.

現行 API
0813 / 0731

API 文件中列出的過時生產版本。.

請勿合併
預覽版 ≠ 專業版

預覽成績無法重新標記為 Pro-0813 成績。.

7 月 31 日的 Flash 更新也公布了代理程式測試結果,並列出了測試框架、設定以及 Codex 支援情況。這些細節至關重要,因為跨廠商排行榜的排名會因測試框架、推理預算、工具定義及重試規則的不同而有所變化。若未附上測試框架,僅憑測試結果尚不足以宣布無條件的勝出者。.

基於同樣的理由,我們的三項任務是與官方證據並存,而非取代它。它們向您說明在某個已公開的設定下發生了什麼事。如果您要比較的是代理程式產品,而非僅是模型 API,我們的 《Codex》與 Claude 編碼指南 說明了為何周邊的工作流程會影響使用者體驗。.

DeepSeek V4 API 定價

DeepSeek 在上線時的 API 定價異常激進。下表列出了 2026 年 8 月 13 日查閱到的官方每百萬代幣定價數據。官方頁面亦警告未來價格將大幅上漲,因此請將這些數據視為上線初期的過時數字。.

官方 API 定價

每 100 萬枚代幣的價格

查閱日期:2026年8月13日
快取命中輸入
閃光燈$0.0028
專業$0.003625
比率1.29×
快取未命中輸入
閃光燈$0.14
專業$0.435
比率3.11×
輸出
閃光燈$0.28
專業$0.87
比率3.11×

以這些費率計算,一個包含 1,000 萬個輸入標記和 200 萬個輸出標記的簡單未緩存工作負載,在 Flash 上的費用為 $1.96,在 Pro 上的費用則為 $6.09。此範例未包含快取命中、供應商加價、重試以及任何後續的價格變動。 各團隊在比較供應商時,應採用統一的令牌組合與計費基準;我們的 Claude Opus 4.6 API 定價指南 說明了為何輸入、輸出和快取需要分別佔用一行。.

1M 上下文視窗的意義——以及其限制何在

100 萬個標記的上下文視窗是一種容量限制,而非保證在每個位置都能達到完美回憶率。這為 API 提供了處理超大型儲存庫、文件集合、研究資料包或代理歷史記錄的空間。關鍵在於,當相關證據被埋沒在數十萬個干擾性標記之中時,模型能否準確檢索出正確的細節。.

DeepSeek 的預覽報告中包含一張涵蓋 8K 至 1M 輸入標記的多輪指代消解(MRCR)圖表。 該曲線在較短的長度範圍內表現強勁,但在 128K 之後開始下滑。這正是長上下文難題的典型徵兆,也是為何「支援 1M」絕不應被解讀為「在 1M 時無損」的原因。“

預覽基準邊界
DeepSeek V4 預覽:從 8K 到 1M 輸入標記的 MRCR 檢索表現
摘自《DeepSeek V4 Preview》技術報告的圖 9。該圖展示 Preview 的檢索行為,並非獨立的 Pro-0813 測試結果。.

API 介面有其自身的限制。DeepSeek 的 回應 API 指南 描述了一種無狀態的實作:諸如以下等功能: 前一則回覆的 ID, 對話、儲存功能及背景均不支援。圖片與檔案輸入同樣不支援,因此您需要在模型外部擷取文字或建立狀態層。.

的 相容於 Anthropic 的 API 表格 同樣地,也會將影像和文件訊息的變體標記為「不支援」。因此,相容性指的是熟悉的請求格式和工具——而非與每個 Anthropic 模型或客戶端在功能上完全一致。.

官方 API 的限制
DeepSeek Anthropic API 相容性對照表,列出不支援的圖片及文件輸入格式
官方的「訊息欄位」資料表將圖片和文件內容的變體標記為「不支援」。.

如何試用 DeepSeek V4 Pro 並進行快閃更新

您有三種實用的方案。請根據您的需求選擇:是想進行快速對話、控制生產環境的 API,還是建立多模型工作區。.

三種實用的路線

選擇您的存取路徑

沒有任何一條路徑能適用於所有工作流程
1號路線

DeepSeek 網頁/應用程式

最適合透過 DeepSeek 自有的使用者介面來試用此模型。.

第 2 號路線

官方 API

最適合用於代幣計費、工具、JSON、代理程式框架以及生產控制。.

3號路線

GlobalGPT

最適合在更廣泛的多模型工作區中開啟 Pro 或 Flash,而無需先建立客戶端。.

路線 1:官方 DeepSeek 聊天室

從……開始 DeepSeek 的官方網站 如果您只是想了解目前的消費者使用體驗。消費者存取與 API 計費是分開的;即使提供線上聊天介面,也不代表該 API 是免費的。.

途徑 2:官方 API 與程式設計代理程式

使用 deepseek-v4-pro 或 deepseek-v4-flash 搭配已記錄的 OpenAI 相容介面。兩者均支援「思考」與「非思考」模式、JSON 輸出、工具呼叫、Responses API,以及 Anthropic 相容存取。FIM 僅適用於「非思考」模式。.

DeepSeek 亦出版一份 官方 Codex 整合指南. 若您正考慮先在代理殼層之間進行選擇,請比較 Claude 代碼的定價與使用限制 在假設模型代幣費用即為整筆帳單金額之前。.

官方整合指南
Codex 官方 DeepSeek V4 整合說明
DeepSeek 的官方 Codex 指南採用 Responses API,並詳述了 V4 模型的配置。.

Claude Code 使用者可遵循我們指南中所述的相同「端點與模型」邏輯,以 在 Claude Code 中設定模型, ,同時檢查 DeepSeek 的即時相容性表格,以確認哪些欄位不受支援。.

路線 3:GlobalGPT

GlobalGPT 針對這兩款型號均設有專屬條目。經確認的轉換路徑為 DeepSeek V4 Pro 搭載於 GlobalGPT 上. 雖然也存在 Flash 產品頁面,但我們並未找到經確認的、專屬於 Flash 的廣告活動參數,因此我們不會自行編造一個。.

「已驗證專業版」存取途徑
DeepSeek V4 Pro 型號的條目位於 GlobalGPT 內
GlobalGPT 提供了一個專用的 DeepSeek V4 Pro 條目。此條目用以確認路由及顯示的型號識別碼,而非基準測試表現。.
已驗證的 Flash 存取路徑
DeepSeek V4 快閃記憶體型號條目位於 GlobalGPT 內
GlobalGPT 亦提供一個專用的 V4 Flash 條目。由於尚未驗證出專屬 Flash 的邀請者,因此該圖像連結至已驗證的 GlobalGPT 常規追蹤路線。.

對於終端工作流程,該 在 Claude 程式碼設定中使用 GlobalGPT CLI 說明了多模型平台如何融入現有的程式編寫流程。它並不會取代原生的儲存庫工具;而是改變您存取和比較模型的方式。.

您應該選擇哪一款 DeepSeek V4 型號?

決策指南

將模型與失效成本相匹配

最佳預設值

閃光燈

建議將其用於高流量聊天、資料擷取、例行程式碼、資料檢索,以及具備強大驗證功能的聊天機器人。它以最低的官方價格,完美通過了我們三項任務中的兩項。.

更高的保證

專業

當嚴格的算術運算、格式設定、政策規範與跨領域推理在同一份交付成果中交匯時,請選擇此模型。它是唯一在我們的備忘錄評分中獲得 12/12 分的模型。.

最簡單的試用版

GlobalGPT

若您想試用該模型或比較不同選項,且無需先編寫 API 客戶端程式,請選擇「平台」途徑。.

對許多團隊而言,Flash 是最明智的首次部署選擇:它成本低廉許多,支援相同的指定上下文與輸出限制,且在執行我們的編碼與 20.7K 次檢索測試時,未出現任何品質問題。此外,還應針對數字、資料結構及必填欄位加入確定性檢查。.

當審閱時間或失敗成本高於使用代幣所節省的費用時,請升級至 Pro 版。價格差距確實存在,但首次就能撰寫出內容精煉的合規或發布備忘錄所帶來的價值同樣不容小覷。若您的候選名單中還包含其他助理工具,更廣泛的 DeepSeek 與 ChatGPT 選購指南 有助於將模型品質與產品生態系統區分開來。.

結論:DeepSeek V4 Pro 值得購買嗎?

當工作需求更重視精準控制而非運算量時,DeepSeek V4 Pro 值得考慮。 這並非經濟實惠的預設選擇:在 API 中,Pro 在主要快取未命中輸入與輸出行上的成本,無論在尖峰或非尖峰時段,皆是 Flash 的三倍。當錯誤的答案會導致返工、審查開銷或營運風險時,這筆額外成本便顯得合理。.

對於例行任務,Flash 提供了成本與規模之間更為簡便的平衡。若處理圖像,則建議使用 Vision-Exp。若目標並非 API 管理,而是要在研究、寫作與技術支援之間切換,那麼採用多模型工作區,往往比分別配置各項服務更為實用。.

下一步

在一個工作區中開啟 DeepSeek V4 Pro,該工作區同時匯集了其他用於研究、寫作及程式碼輔助的模型。.

試用 DeepSeek V4 Pro

關於 DeepSeek V4 的常見問題

DeepSeek V4 Pro 已經發布了嗎?

是的。DeepSeek V4 Pro 已於 2026 年 8 月 13 日正式上市,其生產識別碼為 DeepSeek-V4-Pro-0813。.

DeepSeek V4 Pro 與 Flash 之間有什麼區別?

Flash 優先考量成本與並行處理能力,而 Pro 則專為具有更多限制且失敗代價較高的文字任務所設計。兩者皆支援 100 萬個令牌的上下文視窗,以及最高 384K 個令牌的輸出量。.

DeepSeek V4 Pro 的售價是多少?

每 100 萬個代幣,非高峰時段的 Pro 定價為:快取命中輸入為 $0.022、快取未命中輸入為 $0.66,以及輸出為 $1.98。 尖峰時段的價格分別為 $0.044、$1.32 以及 $3.96。.

API 的尖峰時段是哪些?

尖峰時段為週一至週五的 01:00-04:00 及 06:00-10:00(UTC)。其餘時段均適用非尖峰費率。.

DeepSeek V4 是否支援圖像?

deepseek-v4-flash-vision-exp 支援圖片格式。官方指南列出了 JPEG、PNG、GIF 及 WebP 格式。Pro 型與 Flash 型文字模型應分別處理。.

100萬個代幣的上下文視窗能否保證完美檢索?

不。100萬個代幣的限制是指處理能力。檢索結果仍取決於文件結構、事實的排列位置、提示語以及驗證方法。.

我可以將 DeepSeek V4 與 Codex 搭配使用嗎?

是的。官方文件中描述了透過 Responses API 進行的整合,並列出 Flash、Pro 及 Vision-Exp 作為模型選項。.

如何在不設定 API 的情況下試用 DeepSeek V4 Pro?

您可以使用提供該模型的介面,例如 GlobalGPT。此方案適用於聊天、研究、寫作及技術支援;其計費方式與功能與官方 API 控制台並不完全相同。.

分享文章:

相關文章