Claude Sonnet 5.5 對比 Opus 5.5:價格、效能測試與實際測試

Claude Sonnet 5.5 與 Opus 5.5 比較主視覺圖
Claude 與 5.5 比較 · 相符的 API 任務 · 2026 年 10 月 1 日

Claude Sonnet 5.5 對比 Opus 5.5:價格、效能測試與實際測試

Sonnet 5.5 與 Opus 5.5 同屬 Claude 5.5 世代,但兩者的定價與定位各不相同。本次比較讓兩者執行相同的五個指令,並回報路線實際返回的結果。.

兩者之間的差距主要在於成本與速度。. 在這組包含五個提示的測試中,Sonnet 5.5 不僅完成速度更快、使用的輸出標記更少,且產出的算術請求成本估算值也較低。Opus 5.5 則消耗了更多標記和時間,而其答案往往更為冗長。任務卡顯示了這些額外文字在哪些地方改變了有用的結果,以及兩款模型在哪些情況下僅是通過測試。.

提示、請求上限、工作量設定、終點以及「每種模型執行一次」的設計,均維持與先前版本一致 Claude Opus 5.5 評測.

快速回答

  • 本次配對跑的配速: Sonnet 5.5 在本地環境中於 31.930 秒內完成了五個連續的請求;Opus 5.5 則花了 47.725 秒。.
  • 路由回報的輸出標記: Sonnet 5.5 使用了 2,686;Opus 5.5 使用了 3,952。思考場分別為 987 和 2,214。.
  • 根據算術方法估算的建議零售價: 五筆 Sonnet 請求的總金額約為 $0.02826;五筆 Opus 請求的總金額約為 $0.08184,此計算採用官方標準代幣匯率,且不包含快取、點數、稅金及加價。.
  • 任務結果: 兩款模型均通過了資料擷取、JSON 及數學題目的測試。Sonnet 在維持要求的兩段式中文格式方面表現得更為簡潔;兩者的程式碼輸出結果雖皆可實際運用,但在深度與邊界情況的說明上則有所差異。.
  • API 遷移: 思考無法被禁用;強迫選擇工具的做法將被拒絕,且代幣預算包含思考。請檢查 遷移注意事項 在切換之前。.
  • 決策邊界: 這代表每項任務透過第三方路徑執行一次。其測量對象為觀察到的提示回應、本機實際執行時間,以及路徑回報的使用狀況——並非一項通用的效能評分。.

官方售價與車款規格

Anthropic 目前的模型卡清單中,同時列出了具備 1M 代幣上下文視窗及 128K 最大輸出量的兩種模型。Sonnet 5.5 被標示為 快速 需投入大量精力;Opus 5.5 標示為 適度 以中等預設投入為基準。根據標準代幣匯率,Sonnet 5.5 的輸入與輸出價格均為 Opus 5.5 的半價。.

模型API 識別碼官方延遲標籤輸入/輸出上下文/最大輸出預設的努力程度快取讀取
Claude Sonnet 5.5克勞德-十四行詩-5-5活躍 · 快速每 MTok 為 $2 / $101M / 128K高$0.20 / MTok
Claude Opus 5.5克勞德作品第5號第5首活躍 · 中等$4 / $20 每 MTok1M / 128K中型$0.20 / MTok
Claude Sonnet 5.5 官方文件:每百萬個標記的 1M 上下文、128K 輸出,以及 $2 輸入和 $10 輸出
Anthropic 的 Sonnet 5.5 型號卡片. 標準 API 價格(每百萬個代幣);資料擷取日期:2026 年 10 月 2 日。.
Claude Opus 5.5 官方文件:1M 上下文、128K 輸出,每百萬個標記需 $4 輸入及 $20 輸出
Anthropic 的 Opus 5.5 型號卡片. 標準 API 價格(每百萬個代幣);資料擷取日期:2026 年 10 月 2 日。.

以一個簡單的未快取範例來說,若輸入 100,000 個音節且輸出 20,000 個音節,所列出的音節速率在 Sonnet 5.5 上約為 $0.40,而在 Opus 5.5 上則為 $0.80。 請參閱 Claude 定價與限額指南 用於計畫背景。.

官方基準測試背景

Anthropic’s Sonnet 5.5 公告 將這兩種模式都納入同一張由服務提供者填報的表格中。其列的排列方式會根據基準與工作量設定而有所不同。.

Anthropic 所報告的基準值Sonnet 5.5作品第 5.5 號度量
Terminal-Bench 4.070.6%66.4%¹主體終端編碼
FrontierCode v1.1 (主分支)46.2% Max² / 52.1% Xhigh54.4%程式碼變更是否會被合併
CursorBench 4.055.5%57.8%含糊的多檔案編碼任務
GDPval-AA v2.118441846各職業領域中的知識型工作
人類的最終考驗64.5%(含工具)67.7%(含工具)跨領域推理
OSWorld 2.180.1% 部分81.8% 部分電腦使用任務
製圖學61.6% 無需工具64.4% 無需工具圖表視覺辨識

¹ Opus 5.5 Terminal-Bench 採用 xhigh 運算強度;² Sonnet 5.5 FrontierCode 在 Max 模式下為 46.2%,在 Xhigh 運算強度下為 52.1%。 OSWorld 的數值標示為「部分」。這些屬於服務供應商環境下的數據,並非在相同工作負載下獨立重新執行的結果。.

同一提示詞的 API 方法

每個模型都透過……收到了相同的五個提示 文章連結 https://anywhere.broly.ai/v1/messages. 客戶傳送了一則使用者訊息,, max_tokens:8192, output_config.effort: high, ,且無需任何工具。每個請求都返回 HTTP 200 狀態碼,並且 回合結束.

測量邊界: 「已用時間」是指當地的端到端實際時間,而非服務供應商的延遲。代幣計數和「思考欄」所顯示的數據,則是路由器回報的使用量。.

此測試方法遵循更廣泛的 GlobalGPT 模型測試工作流程. 另一份 Claude API 指南 涵蓋了請求設定與代幣計帳。.

時間、代幣及預估費用

路線當地時間五局輸入代幣輸出標記報導中的想法預估請求費用*
Claude Sonnet 5.531.930 秒7002,686987$0.02826
Claude Opus 5.547.725 秒7003,9522,214$0.08184

* 根據路線回報的代幣數量及官方標準費率估算。在此批次中,Sonnet 5.5 的本地耗時比基準值低 33.1%,產出代幣數比基準值低 32.0%。.

五張配對任務卡

每張卡片會將任務、觀察記錄、當地時間、路線通報代幣、狀態及邊界資訊整合在一起。.

任務 01 · Python 除錯

這些模型能否修復混合型重複資料刪除功能?

配對提示 · 各執行一次

任務設定: 該提示語的原文是從之前的 Claude Opus 5.5 評測 測試套裝。.

模型時間/路線使用情況簡短結果標籤
Claude Sonnet 5.58.679 秒
145 輸入 / 830 輸出
0 則思考
HTTP 200 · 回合結束
修正了函數及兩道習題;說明內容更簡短。.
Claude Opus 5.515.844 秒
145 輸入 / 1478 輸出
700 種思考方式
HTTP 200 · 回合結束
修正了函數並新增兩項測試;對邊界情況進行了更深入的探討。.

觀察到的比較: 兩者都回傳了一個經修正的函式和兩項測試。Sonnet 5.5 使用了帶有類型標籤的鍵,, casefold(), ,而在較短的回應中則採用清單作為備用方案;Opus 5.5 則耗費更多輸出標記來闡述額外的邊緣案例。這兩次執行結果均未能確立一個通用的編碼勝出者。.

邊界: 單一的小型 Python 修補程式僅能檢查具體的邊界案例,而無法確保跨儲存庫或工具驅動編碼的可靠性。.

任務 02 · 接地萃取

這些模型能否在不增添任何主張的情況下,保留所提供的五項事實?

配對提示 · 各執行一次

任務設定: 該提示語的原文是從之前的 Claude Opus 5.5 評測 測試套裝。.

模型時間/路線使用情況簡短結果標籤
Claude Sonnet 5.53.569 秒
210 輸入 / 209 輸出
0 則思考
HTTP 200 · 回合結束
五個編號的要點;保留原始事實。.
Claude Opus 5.54.374 秒
210 輸入 / 312 輸出
101種思考方式
HTTP 200 · 回合結束
五個編號的要點;保留原始事實。.

觀察到的比較: 兩者都精確地回傳了五則編號的要點,並完全符合給定的事實。Sonnet 5.5 產出了 209 個輸出標記,而 Opus 5.5 則產出了 312 個,但前者是基於一篇簡短筆記,而非大篇幅的輸入內容。.

邊界: 這是一項基於實際環境的擷取與格式檢查;這並不代表百萬個標記的語境處理效能。.

任務 03 · JSON 合規性

這些模型能否回傳與請求結構完全一致的結果?

配對提示 · 各執行一次

任務設定: 該提示語的原文是從之前的 Claude Opus 5.5 評測 測試套裝。.

模型時間/路線使用情況簡短結果標籤
Claude Sonnet 5.55.052 秒
128 輸入 / 260 輸出
0 則思考
HTTP 200 · 回合結束
可解析的 JSON;包含請求的鍵與項目數量。.
Claude Opus 5.58.276 秒
128 輸入 / 622 輸出
390 種思考方式
HTTP 200 · 回合結束
可解析的 JSON;包含請求的鍵與項目數量。.

觀察到的比較: 兩者皆回傳了包含所請求鍵值且可解析的 JSON 資料,並各有兩項優點與兩項缺點。Sonnet 5.5 的輸出更為簡潔,僅有 260 個輸出標記;這些字串描述的是一項虛構的評論設定,並非產品事實。.

邊界: 僅執行一次此模式測試,並不足以評估在工具呼叫或長時間對話中結構化輸出的可靠性。.

任務 04 · 算術

這些模型能否將這組循環的批次序列一路推導至最終答案呢?

配對提示 · 各執行一次

任務設定: 該提示語的原文是從之前的 Claude Opus 5.5 評測 測試套裝。.

模型時間/路線使用情況簡短結果標籤
Claude Sonnet 5.52.947 秒
89 個輸入 / 163 個輸出
0 則思考
HTTP 200 · 回合結束
正確答案:67;最終答案應單獨佔一行。.
Claude Opus 5.53.830 秒
89 輸入 / 257 輸出
74 種思考方式
HTTP 200 · 回合結束
正確答案:67;最終答案應單獨佔一行。.

觀察到的比較: 兩者皆計算出 67,並將最終答案單獨列於一行。Sonnet 5.5 產出了 163 個輸出標記,而 Opus 5.5 則為 257 個;在此提示下,兩者未觀察到正確性上的差異。.

邊界: 單一算術數列無法用來評估廣泛推理的可靠性。.

任務 05 · 遵循中文格式

這條路線能否維持所要求的兩段式結構?

配對提示 · 各執行一次

任務設定: 該提示語的原文是從之前的 Claude Opus 5.5 評測 測試套裝。.

模型時間/路線使用情況簡短結果標籤
Claude Sonnet 5.511.683 秒
128 輸入 / 1224 輸出
987 思考
HTTP 200 · 回合結束
兩段中文;無額外框架。.
Claude Opus 5.515.401 秒
128 輸入 / 1283 輸出
949 思考
HTTP 200 · 回合結束
已涵蓋相關要點;新增了 Markdown 格式及英文註解。.

觀察到的比較: Sonnet 5.5 回傳了所要求的兩段中文內容,未附加額外標籤。Opus 5.5 同樣涵蓋了所要求的要點,但添加了 Markdown 標籤及一段英文註解。此記錄僅針對單次執行路徑的格式,而非整體中文品質。.

邊界: 該提示要求撰寫關於《Opus 5.5》的開場白,因此該文本本身並非中立語言的基準。.

API 與遷移注意事項

Sonnet 5.5 預設會執行適應性思考;若設定 thinking: disabled,則會回傳 400 錯誤,且 max_tokens 包含思考及回應文字的總量。強制設定 tool_choice any/tool 將被拒絕。請依類型解析內容區塊,並在切換前重新設定代碼預算基準。.

證據所支持的內容

任務層級的裁決

Sonnet 5.5: 在這條航線上,測量出的成本和時間均較低,且在中國任務中完全符合格式規範。.

作品第 5.5 號: 在此處價格更高且範圍更廣;在數項開放式任務中,官方基準測試結果仍保持領先。.

利用任務層級的證據來選擇一個起點,然後驗證對您而言重要的工作量。.

有關相關背景,請參閱 Claude 系列產品比較, 《Opus 5》評測, 以及 Fable 5.1 評論.

常見問題

在對比測試中,哪一款機型的速度較快?

在五次連續請求中,Sonnet 5.5 的本地總延遲較低:31.930 秒,而 Opus 5.5 則為 47.725 秒。此數值已包含此處使用的路由與網路路徑,因此並非來自服務供應商端的延遲。.

哪個模型產出的標記數量較少?

Sonnet 5.5 在五項任務中共使用了 2,686 個路徑報告的輸出標記,而 Opus 5.5 則為 3,952 個。僅憑標記數量並不能證明答案的品質。.

在這次測試中,哪一款車型更便宜?

根據官方標準 API 費率及回傳的輸入/輸出次數,這五筆 Sonnet 5.5 請求的估算總額為 $0.02826,而 Opus 5.5 則為 $0.08184。 此計算未包含快取費用、平台抵免額、稅金及加價。.

Sonnet 5.5 在每項基準測試中都比 Opus 5.5 表現更好嗎?

Anthropic 的專屬表格中,各項成績因基準測試與運算強度設定而有所差異: Sonnet 5.5 在 Terminal-Bench 4.0 上的表現更佳,而 Opus 5.5 則在 FrontierCode、CursorBench、GDPval-AA、Humanity’s Last Exam、OSWorld 及 Chartography 上的表現更佳。這些均為供應商提供的測試結果,並非經獨立重新測試所得。.

Sonnet 5.5 是否為可直接替換的 API?

不。遷移指南指出,預設情況下「thinking」會自動執行;若將「thinking」設為「disabled」,將會返回 400 錯誤;強制設定工具選擇為「any/tool」將被拒絕;且客戶端應根據類型解析內容區塊。切換前,請重新建立標記預算和工具迴圈的基準。.

這是一項長文脈標竿測試嗎?

不。萃取提示中包含一段簡短的文字。它會檢查事實依據與格式是否正確;但不會評估在文檔中記載的 100 萬個標記上下文視窗範圍內的行為。.

分享文章:

相關文章