Kimi K3 正是那種一旦跳脫表面數據的框架,便會顯得更加引人入勝的新產品之一。 沒錯,它擁有 2.8 兆個總參數、1,048,576 個標記的上下文視窗,並支援圖像輸入。更重要的是,初步的基準測試結果顯示,這個模型是專為高難度的編碼、研究及知識型工作任務所打造,而非用於快速且曇花一現的聊天。.
我的看法:若您需要編寫或除錯程式碼、處理大型研究資料包,或是經常向 AI 提供超出一般聊天視窗處理能力的資料,建議從 K3 開始使用。 Moonshot AI 在程式設計與知識工作方面的表現十分出色,而早期的第三方基準測試也佐證了這確實是一款值得重視的前沿模型。其取捨在於,K3 預設會進行深度思考,因此它更適合用於重要工作,而非快速草擬。.
如果 K3 是您想用來處理嚴肅工作的機型,, GlobalGPT 讓您能更全面地圍繞它進行開發。一個工作區涵蓋聊天、研究、寫作、程式碼協助、文件審閱、影像生成、影片製作以及模型切換等功能,因此 K3 能夠處理長上下文推理任務 而 GPT、Claude、Gemini、Perplexity 及其他模型則負責處理它們更擅長的步驟。若採用年度計費方式,Pro 方案是 $10.80/ 月 而「Unlimited」是指 $25/月, ,這使得 GlobalGPT 成為一種實用的方式,讓使用者能運用多款頂尖 AI 工具,而無需為工作流程的每個環節分別支付訂閱費用。.
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 的旗艦推理模型,於 2026 年 7 月 16 日發布。該 正式發布貼文 該模型採用專家混合(MiXM)架構,總參數數達 2.8 兆,並整合了 Kimi Delta Attention、Attention Residuals、原生視覺理解能力,以及 100 萬個標記的上下文視窗。它能接受文字和圖像作為輸入,並輸出文字。.
關於「2.8T」這個標題,需要稍作說明。K3 並不會針對每個標記都使用所有參數。Moonshot 表示,它會將每個步驟路由至 896 位專家中的 16 位,這是一種務實的做法:既能為困難的請求提供更多處理能力,又不會將每個小問題都當作繁重的任務來處理。.
Kimi K3 產品概覽
| 發布 | 2026年7月16日 |
|---|---|
| 參數總數 | 2.8T MoE;896位專家中有16位處於活躍狀態 |
| 上下文 | 1,048,576 個代幣 |
| 治療方式 | 文字與圖像輸入;文字輸出 |
| 啟動 API | 僅限最大推論;固定取樣設定 |
該架構試圖解決的問題
Kimi Delta 的「Attention」與「Attention Residuals」是 Moonshot 針對一個常見的長上下文問題所提出的解決方案:當輸入規模變得非常龐大時,仍能確保相關資訊可供使用。Moonshot 表示,相較於 Kimi K2,此方法能提升擴展效率。這屬於廠商宣稱的內容,因此應視為設計意圖,而非經獨立驗證的效率結果。.
「發佈」API 對買家而言影響更為直接。其 官方快速入門指南 僅支援 max 推理,其請求設定固定,包括 溫度 1.0, top_p 0.95,以及 n 1. 換句話說,K3 首先針對的是棘手的問題;目前還無法將其簡化,以進行廉價且快速的重寫。.
Kimi K3 效能測試:官方數據與獨立測試結果的對比
K3 的登場,其效能基準測試報告比多數新產品發布時更為全面。Moonshot 自身測試結果涵蓋程式設計、智慧代理、瀏覽、試算表及知識工作等領域。 Artificial Analysis 補充了一項獨立的智慧指數,而 Arena 則提供了使用者對其輸出結果反應的初步觀察。綜合這些數據來看,K3 確實有充分理由被列入候選名單。.
Moonshot AI 的財報結果
Moonshot 在類似長期編碼、代理任務、網路研究及知識工作等任務上表現尤為出色。 亮點包括在 Terminal-Bench 2.1 獲得 88.3 分、FrontierSWE 獲得 81.2 分、Program Bench 獲得 77.8 分、GDPval-AA v2 Elo 分數達 1668,以及在 BrowseComp 獲得 91.2 分。 其視覺代理圖表顯示,在 CharXiv 研究問題(使用工具輔助)的測試中獲得 91.3 分。.
實際上的啟示很明確。K3 在多步驟編碼、研究密集型工作,以及需要模型持續掌握大量上下文的任務中,表現尤為出色。Moonshot 也將其歸類為「前沿組」,而非宣稱它在每個類別都勝出,對於一個目標受眾如此廣泛的新模型而言,這種定位方式似乎是正確的。.


| 基準 | 報告結果 |
|---|---|
| Terminal-Bench 2.1 | 88.3 |
| FrontierSWE | 81.2 |
| GDPval-AA v2 | 1668 Elo |
| BrowseComp | 91.2 |
| 附帶工具的 CharXiv RQ | 91.3 |
供應商報告的結果是有用的篩檢依據,而非獨立的複現研究。.
K3 目前已位居頂尖行列
最明顯的早期跡象之一,就是《K3》在 Moonshot 自身排行榜之外的排名。它在該排行榜上獲得了 57 分, 人工智慧分析指數, ,在 2026 年 7 月 17 日的評測中,於 189 款同類模型中名列第四。對於一款新推出的產品而言,這是一個強勁的開局,尤其是因為 K3 瞄準的是市場中更具挑戰性的領域:程式設計、代理式工作、科學推理及複雜分析,而非單純的聊天功能。.
其效能表現也合乎邏輯。K3 約在 1.99 秒內開始回應,並每秒產生約 62 個輸出標記,但其輸出量高於對照組的平均值。 說得通俗一點,它的設計宗旨是逐步解決問題,而非急於給出簡短答案。這正是你在除錯程式碼、分析報告或彙整研究資料時所需要的。若只是快速重寫程式或回覆一行文字,它的處理能力恐怕超出了你的需求。.

其早期在 Web 開發領域取得的成果,實在難以忽視
K3 在 Arena 的 Code WebDev 初步排行榜上以 1,757 票、1,679 +17/-17 的成績位居榜首。其一般文本評分則較低,以 3,024 票、1,486 ±11 的成績排名第九。 這種差距揭示了一個有意義的現象:K3 並非僅靠閒聊來取勝。當任務呈現出真實產品開發工作的樣貌時,其早期優勢便顯現出來。.
無論您是開發前端、為產品構想製作原型,還是每天都在程式碼與產品需求之間進行轉換,現在都值得試試 K3。WebDev 的指標也與 Moonshot 自身的編碼結果相符,因此這絕非僅僅是個華而不實的數字。若想了解更廣泛的市場觀點,請參閱我們的指南: 最佳的人工智慧模型.

- K3 的推出成果在程式設計、代理程式、瀏覽及知識工作方面表現最為突出。.
- 第三方數據證實,該車型確實名列當今性能較佳的車款之列。.
- 1M 的上下文視窗使其在處理大量原始資料的任務時具備顯著優勢。.
- 在需要更深入推理,且值得投入額外時間與產出成本的情況下,請使用此功能。.
Kimi K3 在哪些方面最顯得實用
K3 並非試圖成為每項 AI 任務的預設解答。其初期展現出的最強優勢,在於處理真正具有深度的任務:大型文件、研究綜述、程式碼以及多步驟專案。這正是我會開始使用它的領域。.
100 萬字元的上下文視窗讓 K3 有足夠空間處理報告、研究資料包以及冗長專案歷史紀錄,無需將所有內容切分成零碎的提示。.
長篇文件:一個自然的起點
100 萬個代幣的處理量,讓 K3 有足夠空間處理年度報告、法律附件、研究資料包以及大型專案歷史紀錄。若您已厭倦在提問前必須將文件分割成零碎片段,光是這一點就足以讓它極具吸引力。其知識工作效能基準更進一步印證了這一點。 在文件分析方面,我會先使用 K3 進行初步篩選,接著再核對最重要的圖表和頁碼參考。我們的指南 AI 助理如何閱讀 PDF 檔案 解釋了為何特徵提取步驟與模型同樣重要。.
K3 在將龐大的資料包轉化為清晰的任務簡報、梳理相互矛盾的主張,以及從雜亂的研究中找出主線方面,顯得特別實用。.
研究綜述:適用於「混亂的中間階段」
研究工作通常在中間階段會變得棘手:資料來源過多、存在細微分歧,且必須同時掌握大量背景資訊。BrowseComp、獨立情報評分以及 K3 的背景資訊視窗,使其成為處理此階段工作的理想工具。 利用它來梳理論點脈絡、提煉出分歧之處,並將冗長的資料包轉化為實用的簡報。Moonshot 的網頁搜尋工具在推出時仍在持續更新中,因此若面臨時效性較高的工作,建議自行準備資料來源並隨時備用。.
K3 的程式設計基準測試成績以及早期 WebDev 成果,使其成為處理錯誤、功能開發,以及涉及多個變動部分的專案時的絕佳選擇。.
程式設計:嘗試它的最明確理由
K3 的官方編碼套件及其「Arena WebDev」成果,正是值得一試的最明確理由。當需求涉及多個環節時——例如理解程式碼庫、追蹤錯誤、進行修改,以及闡明取捨——這正是我會優先選擇的模式。 一次妥善的測試應選用您自身儲存庫中的一個真實錯誤或功能級別的變更,而非泛用的程式設計提示。這正是其「長篇上下文」與「推理預算」得以發揮價值之處。.
原生圖片輸入功能讓 K3 成為您在需要快速呈現主要內容時,製作報告、圖表、示意圖和螢幕截圖的絕佳幫手。.
圖表與視覺化分析:適用於初步分析
當報告中充斥著圖表、示意圖和螢幕截圖時,原生影像輸入功能使 K3 比純文字模型更具實用性。 Moonshot 的視覺化代理工具所呈現的成果令人鼓舞,對於那些花在簡報和報告上的時間,遠多於處理整潔 CSV 檔案的團隊而言,更是如此。我會先利用它將故事以圖表形式呈現出來,然後養成一個快速習慣:在傳達結論之前,先檢查坐標軸、圖例和單位。.
K3 具備足夠的語境容量,足以處理會議記錄、多份文件的摘要以及分析報告等內容,這些內容若在一般聊天中出現,恐怕會讓人應接不暇。.
辦公室工作與多檔案處理:提升生產力的明智之舉
會議記錄、多文件摘要以及分析資料包,都是 K3 的合理應用場景。該模型不僅具備處理原始資料所需的語境彈性空間,也擁有專業工作基準,足以讓這個構想具有說服力。 整體使用體驗將取決於相關檔案與工具,但對於日常知識工作而言,這是我會優先推薦嘗試的模型之一。若您需要處理多個原始檔案,請參閱這份指南: 處理整個資料夾 這是一份關於應核實事項的實用檢查清單。.
當代理需要蒐集背景資訊、經過數個步驟進行推理,並完成一項定義明確的任務時,K3 便是一個值得考慮的選擇。.
代理工作流程:當任務有明確目標時,前景可期
K3 的代理基準測試使其成為處理具有明確終點任務時的有趣選擇:例如調查問題、蒐集相關資料、進行變更,或是準備簡報。Kimi Work 和 Kimi Code 能為該模型提供實用的輔助工具,而 API 使用者則可自行規劃路徑。 若能為代理設定明確的目標,並提供驗證其工作成果的方法,將能獲得最佳成效。對於以研究為導向的代理,我們的 深度研究工作流程指南 內容涵蓋了值得保持的習慣。.
該先試試什麼
該先試試什麼
| 工作流程 | 為什麼 K3 適合 | 最佳入門任務 |
|---|---|---|
| 編碼 | 最明確的早期跡象 | 真正的錯誤,還是屬於「功能級」的變更 |
| 長篇文件 | 1M上下文視窗 | 年度報告或研究資料包 |
| 研究 | 擅長將相互矛盾的資料來源整合在一起 | 一場有消息來源佐證的簡報會 |
| 視覺分析 | 原生影像輸入 | 一份圖表豐富的報告 |
| 辦公室工作 | 有用的背景餘裕 | 會議記錄及相關檔案 |
進行評估的理由
- 1M-token 語境視窗
- 強烈的早期編碼訊號
- 文字與圖片輸入
- 具競爭力的獨立指數結果
應謹慎的理由
- 僅限發行當日進行 Max 推理
- $15/M 輸出代幣
- 此處尚未驗證任務層級的可靠性
- 捕獲時未公布體重及技術報告
Kimi K3 的限制與發售當日的注意事項
在考慮採用 K3 之前,最關鍵的一點是:它專為嚴謹的工作而設計。 「最大推理能力」功能始終處於啟用狀態,且固定取樣控制機制使您在調整速度、成本及回應風格方面的彈性較低。對於除錯或研究而言,這是一項合理的取捨。但對於大量分類、簡短重寫,或是長篇回應多屬浪費的任務而言,這則顯得過於強大。.
輸出是這筆帳單中成本較高的一環。 以每百萬個輸出代幣需消耗 $15 為基準,一個會「大聲思考」的模型成本可能會迅速飆升。這未必是致命的缺陷:若能為工程師節省一個下午的時間,幾分錢或幾美元的成本或許微不足道。但這確實意味著,在設定預算之前,您應仔細檢視每週執行的任務中,輸入與輸出的相關成本。.
第三,截至證據提交日,K3 的開放式重量方案仍僅為一項承諾。Moonshot 表示,完整重量數據將於 2026 年 7 月 27 日前公布,並將一併提供更多技術細節。經於 7 月 17 日查證,官方 Moonshot AI Hugging Face 組織 並未列出 K3。在儲存庫、授權條款、模型卡及檔案正式上線之前,「計畫中的開放重量版發行」比「可供自行架設」這個說法更為精確。“


發售當日的購買限制需留意
- 此 API 僅支援最大推理功能,且採固定取樣設定。.
- 輸出成本可能會在冗長的推理工作流程中佔據主導地位。.
- 官方網路搜尋工具已被標記為已更新。.
- 某項產品功能或第三方整合功能,並不一定自動成為基本機型的功能。.
Kimi K3 定價
Moonshot 於 2026 年 7 月 17 日公布 Kimi K3 API 的定價為:每百萬個快取命中輸入代幣為 $0.30,每百萬個未快取輸入代幣為 $3,以及每百萬個輸出代幣為 $15。 語境視窗為 1,048,576 個代幣。這些為官方 API 定價,尚未包含稅金及任何第三方供應商的加價。.

官方 API 每百萬個代幣的定價
成本主要取決於產出
計算方式很簡單:以相關快取率計算輸入代幣,再加上每百萬個輸出代幣的 $15。一個包含 100,000 個未快取輸入代幣和 10,000 個輸出代幣的請求,計算結果約為 $0.45。 一份包含 200,000 個輸入代幣且有 5,000 個輸出代幣的報告,約為 $0.675。 若包含 100 萬個未緩存的輸入標記和 50,000 個輸出標記,則約為 $3.75。這些僅為算術範例,並非來自私有測試的實際帳單。.
API 成本範例說明
| 請求 | 估計成本 |
|---|---|
| 100K 未快取輸入 + 10K 輸出 | $0.45 |
| 200K 未緩存輸入 + 5K 輸出 | $0.675 |
| 100 萬筆未快取的輸入 + 5 萬筆輸出 | $3.75 |
消費者存取權限與 API 存取權限屬於不同的購買項目
消費者方案、直接 API 帳戶以及第三方多模型訂閱,各自能解決不同的問題。對於聊天和檔案處理而言,消費者方案通常是較為簡便的選擇;API 則適用於建立工作流程和追蹤代幣。方案權益與區域可用性會有所變動,因此請在將上市價格視為永久優惠之前,先確認您打算採用的方案。.
選擇該工作的前往路線
消費者方案 通常是進行聊天和傳輸檔案最簡單的方式。. API 是用來建立和衡量工作流程的。. 多模型工作區 當您想比較不同模型間相同的實際任務時,這項功能相當實用。可用性與配額會因方案和區域而異。.
哪裡可以試駕 Kimi K3?
您可以透過 Moonshot 的消費級產品或 API 來評估 K3,但須受各管道的可用性及使用限制所限。 若您的實際問題是「哪種模型最適合處理這項任務?」,多模型工作區可能是較為輕鬆的起點:使用相同的代表性提示詞和檔案,無需為每個模型重新建置 API 設定,即可直接比較結果。.
試試 Kimi K3 的 GlobalGPT 規格 如果您想在同一個工作區中,將其與其他現有模型一併進行測試。這僅是一種存取選項,並非聲稱每個方案都包含所有 K3 功能,亦非表示它能取代用於開發的直接 API。.
- 針對一般聊天與檔案工作流程所設計的「Moonshot」級消費性產品。.
- 適用於開發、代幣追蹤及自訂整合的 Moonshot API。.
- 一個用於在現有模型間比較單一代表性任務的多模型工作區。.
誰應該將基米 K3 列入候選名單?
K3 非常適合經常處理複雜原始資料或大型專案的研究人員、分析師及開發人員。此外,當報告內容相當龐大,需要透過實際推理來處理,而非僅靠快速套用範本來應對時,對於圖表密集的報告及辦公室工作而言,K3 也值得一試。.
若您的優先考量是盡可能降低代幣成本、尋求適用於例行工作的輕量級模式,或是希望立即實現自託管權重,建議您另尋他法。至於其他使用者,則應將 K3 視為一個極具吸引力的新選擇:賦予它實際任務,將結果與您已信賴的工具進行比較,並評估這額外的推理過程是否值得等待。.
最後判斷
Kimi K3 是今年較為引人注目的新產品之一。初期獨立數據與 WebDev 訊號均佐證了 Moonshot 的說法,而 100 萬字的上下文視窗則為其提供了明確的實用價值。從程式設計、研究以及處理大型文件開始;這些正是其設計最顯著的優勢所在。.
K3 並非適用於所有提示詞的最佳選擇,其定價也與一般閒聊型模型不同。但若工作內容足夠複雜,足以讓模型花時間思考,那麼它就值得在您的工具箱中佔有一席之地。 最簡單的判斷方式,就是讓它處理那些通常會拖慢團隊進度的任務,並將結果與你目前使用的模型進行比較。.
如果您想以更簡單的方式比較實際穿著的合身度,, 參閱 GlobalGPT 計畫 並將相同的實際任務套用至您可用的模型上進行執行。.
常見問題
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 的旗艦推理模型,於 2026 年 7 月 16 日發布。 Moonshot 表示,該模型總參數數達 2.8 兆,可調用 896 位專家中的 16 位,支援文字與圖像輸入,並具備 1,048,576 個標記的上下文視窗。.
Kimi K3 是開源的,還是開放重量規格的?
Moonshot AI 表示,K3 的完整權重將於 2026 年 7 月 27 日前發布。經 7 月 17 日查證,官方 Hugging Face 組織尚未列出 K3。在儲存庫與授權條款公布之前,「計畫中將開放權重」是對此最精確的描述。.
Kimi K3 的價格是多少?
7月17日記錄的官方 API 價格為:每百萬個已快取的輸入代幣為 $0.30,每百萬個未快取的輸入代幣為 $3,每百萬個輸出代幣為 $15。稅金、服務提供商加價、配額及區域定價均可能影響最終成本。.
我可以免費試用 Kimi K3 嗎?
Kimi 的消費者定價頁面於 7 月 17 日顯示提供免費的 Adagio 方案,而 K3 則可透過付費或配額制方式取得。免費服務的可用性可能受地區、容量及使用配額的限制,因此不應假設其為無限量。.
Kimi K3 真的支援 1M 代幣的上下文視窗嗎?
是的。官方的快速入門與定價頁面列出了 1,048,576 個代號的上下文視窗。這是最大上下文容量,並不保證每則針對長篇文件的回答都會準確無誤或完整引用來源。.
Kimi K3 能否分析 PDF、圖表和試算表?
K3 可處理文字與圖像,而 Moonshot 則針對試算表及視覺代理程式基準測試報告結果。本評測並未針對 PDF、圖表或試算表進行任務層級的驗證,因此使用者應自行核對確切數值、頁碼參照、圖例、公式以及遺漏的行。.
Kimi K3 適合用於研究和辦公室工作嗎?
根據現有的基準測試結果,K3 值得列入研究與辦公室工作的候選名單,特別是在處理長篇文件及結構化分析方面。目前尚無法驗證其在特定工作流程下的引用準確性、多檔案處理的可靠性,以及產出品質。.
我可以在 Codex 中使用 Kimi K3 嗎?
Moonshot 發布了一份 Codex 整合指南,說明如何使用 CC Switch 將 Codex Responses API 的流量轉換為 Kimi Chat Completions。由於 CC Switch 屬於第三方軟體,因此各組織在使用機密儲存庫或文件之前,應先審查其資料傳輸路徑及安全性要求。.
Kimi K3 與 Kimi Work 之間有什麼區別?
Kimi K3 是一款模型。Kimi Work 則是一個產品環境,將模型與檔案、工具、瀏覽器操作、Office 文件建立、排程任務及其他工作流程功能整合在一起。Kimi Work 中展示的功能,並不一定自動代表單純的 K3 API 呼叫所具備的能力。.


