Kimi K3 评测:性能测试、价格及最佳用途

Kimi K3,一款用于编程、研究和长上下文处理的前沿推理模型。.

Kimi K3 是一款一旦你跳出那些头条数据来看,就会发现它其实更有意思的新产品。 没错,它拥有2.8万亿个总参数、1,048,576个令牌的上下文窗口,并支持图像输入。更重要的是,早期基准测试结果表明,该模型专为高要求的编程、研究和知识型工作任务而设计,而非用于快速、一次性使用的聊天场景。.

我的建议:如果你需要编写或调试代码、处理大型研究资料包,或者经常向AI提供超出普通聊天窗口处理能力范围的材料,建议从K3开始使用。 Moonshot AI在编程和知识工作方面的表现非常出色,早期第三方基准测试也印证了它是一款真正具有前沿意义的模型。其取舍在于,K3默认会进行深度思考,因此它更适合处理重要工作,而非快速草拟。.

如果K3正是您想要用于专业工作的机型,, GlobalGPT 为您提供了更全面的操作方式。一个工作区即可涵盖聊天、研究、写作、编程辅助、文档审阅、图像生成、视频制作以及模型切换等功能,因此 K3 可以处理长上下文推理任务 而GPT、Claude、Gemini、Perplexity及其他模型则负责处理它们更擅长的环节。采用按年计费的方式,Pro版是 $10.80/月 而“Unlimited”是指 $25/月, ,这使得 GlobalGPT 成为一种实用的解决方案,用户无需为工作流的每个环节分别订阅服务,即可使用多款领先的 AI 工具。.

Kimi K3:简评
最适合编码、大篇幅文档、研究资料包以及多步骤工作。.
它为何脱颖而出100万词的上下文窗口,以及在早期编码和推理方面的强劲成果。.
请记住“最大推理”功能始终处于开启状态,因此它更适合进行有意义的工作,而非简短的聊天。.

什么是Kimi K3?

Kimi K3 是 Moonshot AI 的旗舰推理模型,于 2026 年 7 月 16 日发布。该 正式发布帖 该模型描述了一种混合专家模型,其总参数数为2.8万亿,包含Kimi Delta Attention、Attention Residuals、原生视觉理解功能以及100万令牌的上下文窗口。它接受文本和图像作为输入,并返回文本。.

“2.8T”这个标题需要稍作解释。K3 并非对每个令牌都使用所有参数。Moonshot 表示,它会将每个步骤路由至 896 位专家中的 16 位,这是一种切实可行的方法,既能为复杂请求提供更多处理能力,又不会将每个小问题都当作高负载任务来处理。.

Kimi K3 概览

发布2026年7月16日
参数总数2.8T MoE;896位专家中有16位处于活跃状态简体中文(大陆)
背景1,048,576 个代币
治疗方式文本和图像输入;文本输出
API 发布仅限最大推理;固定采样设置
来源:Moonshot AI 文档,2026年7月17日截图。.

该架构试图解决什么问题

Kimi Delta Attention 和 Attention Residuals 是 Moonshot 针对一个常见的长上下文问题提出的解决方案:当输入规模变得非常庞大时,如何确保相关信息仍可获取。Moonshot 表示,与 Kimi K2 相比,该方法提高了可扩展性效率。这属于厂商的宣称,因此应将其视为设计意图,而非经过独立验证的效率结果。.

该发布 API 对买家产生的影响更为直接。其 官方快速入门指南 仅支持 max 推理,其请求设置固定,包括 温度 1.0, top_p 0.95,以及 n 1. 换句话说,K3 首先针对的是棘手的问题;目前还无法将其简化,以实现廉价、快速的重写。.

Kimi K3 基准测试:官方数据与独立测试结果对比

K3的发布带来了比大多数新品发布更全面的基准测试数据。Moonshot自己的测试结果涵盖了编程、智能代理、网页浏览、电子表格和知识工作等领域。 Artificial Analysis 补充了一项独立的智能指数,而 Arena 则提前展示了人们对其输出结果的反应。综合来看,这些数据有力地证明了将 K3 列入候选名单的合理性。.

Moonshot AI的已公布业绩

Moonshot 在长周期编码、智能体任务、网络研究和知识工作等任务上表现尤为出色。 其亮点包括:在 Terminal-Bench 2.1 测试中获得 88.3 分,在 FrontierSWE 测试中获得 81.2 分,在 Program Bench 测试中获得 77.8 分,GDPval-AA v2 Elo 评分为 1668,以及在 BrowseComp 测试中获得 91.2 分。 其视觉智能体图表显示,在利用工具解答 CharXiv 研究问题时,得分达到 91.3。.

实际的启示很简单。K3在多步骤编码、研究密集型工作以及需要模型持续关注大量上下文的任务中表现尤为出色。Moonshot也将它归类为“前沿组”,而非宣称其在每个类别中都胜出——对于一个目标受众如此广泛的新模型而言,这种定位方式似乎更为恰当。.

Moonshot AI 的发布资料将 Kimi K3 与其他前沿模型进行了对比,同时承认该模型在整体上仍落后于领先者。.
Moonshot AI 在专业任务、自动化任务、研究任务和视觉代理任务方面均取得了优异成绩。.
Moonshot AI 公布的基准测试结果
基准报告结果
终端平台 2.188.3
FrontierSWE81.2
GDPval-AA v21668 Elo
BrowseComp91.2
带工具的CharXiv RQ91.3

供应商报告的结果可作为有用的筛查依据,但并非独立验证。.

K3 目前已跻身顶尖行列

最明显的早期迹象之一,就是《K3》在Moonshot自有排行榜之外的排名。它在该榜单上获得了57分, 人工智能分析指数, ,在2026年7月17日的评估中,该模型在189款同类模型中排名第四。对于一款新发布的模型而言,这是一个强劲的开局,尤其是考虑到K3瞄准的是市场中难度较高的领域:编程、智能体式任务、科学推理和复杂分析,而非简单的聊天。.

其性能特征也合乎情理。K3 约在 1.99 秒内开始响应,每秒生成约 62 个输出令牌,但其输出量高于对比组的平均水平。 通俗来说,它的设计初衷是深入分析问题,而非匆忙给出简短答案。这正是你在调试代码、分析报告或整理研究资料时所需要的。但如果是快速重写代码或回复一行文字,它的处理能力可能就有些过剩了。.

Artificial Analysis 将 Kimi K3 的智能指数评定为 57,并测得其每秒输出 62 个代币。.
2026年7月17日捕获的独立信号
57人工智能分析指数
#4 / 189捕获时的人工分析排名
#1Arena Code WebDev 预览版;1,757 票

其早期在Web开发领域的成果不容忽视

K3在Arena的Code WebDev初步排行榜上以1679分(+17/-17)的成绩位居榜首,该成绩基于1,757张选票。而在通用文本测试中,其表现相对较弱,以1486分(±11)的成绩位列第九,该成绩基于3,024张选票。 这种差异揭示了一个有意义的现象:K3 并非仅靠日常对话来取胜。当任务呈现出真实产品工作的特征时,它便展现出了早期优势。.

无论你是从事前端开发、为产品创意制作原型,还是每天都在代码与产品需求之间进行转换,现在都值得尝试一下 K3。WebDev 的数据也与 Moonshot 自身的编码结果相吻合,因此这绝不仅仅是一个花哨的数字。如需了解更广泛的市场视角,请参阅我们的指南: 最佳的AI模型.

截至7月17日,Kimi K3在Arena的WebDev排行榜上以1,757票暂居榜首。.
简版
  • K3在编程、智能代理、浏览和知识工作方面的发布成果最为突出。.
  • 第三方数据证实,该车型跻身当今性能更出色的车型之列。.
  • 1M的上下文窗口使其在处理大量源代码的任务时具有显著优势。.
  • 在需要更深入的推理且值得为此投入额外时间和计算成本的情况下使用它。.

Kimi K3 在哪些方面最实用

K3 并不试图成为所有 AI 任务的默认答案。其早期表现最突出的领域,正是那些真正具有深度的任务:大型文档、研究综述、代码以及多步骤项目。我会从这些方面开始使用它。.

长篇文件和报告
一个很好的起点
1M-token的上下文窗口为K3提供了足够的空间,可以处理报告、研究资料包和冗长的项目历史记录,而无需将所有内容都拆分成零散的提示词。.

长篇文档:一个自然的切入点

100万个令牌的处理窗口为K3提供了处理年度报告、法律附件、研究资料包以及大型项目历史记录的空间。仅此一点,就足以让它对那些厌倦了在提问前将文档拆分成碎片的用户极具吸引力。其知识工作基准测试结果进一步印证了这一点。 在文档分析方面,我会先用 K3 进行初筛,然后核对最重要的图表和页码引用。我们的指南 AI助手如何阅读PDF文件 解释了为什么特征提取步骤与模型同样重要。.

研究综述
值得一试
K3 在将庞大的资料包转化为清晰的任务说明、梳理相互矛盾的论点,以及从杂乱的研究中找出主线方面,显得尤为有用。.

研究综述:适用于复杂的中间阶段

研究工作通常在中间阶段会变得困难:资料来源过多、存在细微分歧,而且需要同时掌握大量背景信息。BrowseComp、独立情报评分以及K3的背景窗口功能,使其成为处理这一工作阶段的理想工具。 利用它来梳理论点、提炼分歧,并将冗长的资料包转化为实用的简报。Moonshot的网页搜索工具在发布时仍在更新中,因此对于时间紧迫的工作,建议自备资料并随时备查。.

编程与网页开发
尝试它的首要理由
K3 的编码基准测试和早期 WebDev 成果使其成为处理 bug、功能开发以及涉及多个组成部分的项目的理想选择。.

编程:尝试它的最充分理由

K3 的官方编码套件及其’Arena WebDev”成果,无疑是尝试该工具的最有力理由。当需求涉及多个环节时——例如理解代码库、排查 bug、进行修改以及解释权衡取舍——这正是我会优先选择的模式。 一次恰当的试用应该选用您自己代码库中一个真实的 bug 或功能级别的变更,而不是泛泛的编码提示。这正是其长上下文和推理配额大显身手之处。.

图表与基于图像的作品
有用的初步尝试
原生图片输入功能使 K3 成为制作报告、图表、示意图和截图的得力助手,尤其在您需要快速呈现核心内容时。.

图表与可视化分析:适用于初步分析

当报告中充斥着图表、示意图和截图时,原生图像输入功能使 K3 比纯文本模型更具实用价值。 Moonshot的视觉代理功能表现令人鼓舞,特别是对于那些处理演示文稿和报告的时间远多于处理标准CSV文件的团队而言。我会用它将故事内容以图表形式呈现出来,然后养成一个好习惯:在传达结论之前,先快速检查一下坐标轴、图例和单位。.

办公及多文件处理
效率之选
K3 拥有足够的上下文容量,可以处理会议纪要、多文档摘要和分析资料包等内容,而这些内容如果放在普通聊天中会让人应接不暇。.

办公与多文件处理:提升工作效率的明智之选

会议纪要、多文档摘要和分析资料包都是 K3 的合理应用场景。该模型在源材料的语境处理能力以及专业工作基准方面都留有余地,这使得这一构想具有可信度。 完整的体验将取决于相关的文件和工具,但对于日常知识工作而言,我会将该模型列为首批值得尝试的选项之一。如果您需要处理多个源文件,请参考这篇指南: 处理整个文件夹 这是一份关于需要核查事项的实用检查清单。.

代理工作流
适合设定明确的目标
当智能体需要收集背景信息、经过多步推理并完成一项定义明确的任务时,K3 是一个值得考虑的选择。.

智能体工作流:当任务目标明确时前景可期

K3的代理基准测试使其成为处理具有明确目标的工作时的有趣选择:调查问题、收集相关材料、进行修改或准备简报。Kimi Work 和 Kimi Code 可以为该模型提供有用的工具,而 API 用户则可以构建自己的工作流程。 要获得最佳效果,应为智能代理设定明确的目标,并提供验证其工作成果的方法。对于以研究为导向的智能代理,我们的 深度研究工作流指南 介绍了值得养成的习惯。.

先尝试什么

先尝试什么

工作流程为什么K3是理想之选最佳入门任务
编码最强的早期信号真正的错误,还是功能级别的变更
长文件1M 上下文窗口年度报告或研究资料包
研究擅长将相互矛盾的信息来源整合在一起有消息来源佐证的简报
视觉分析原生图像输入一份图表较多的报告
办公室工作有用的上下文余量会议纪要及相关文件

进行评估的理由

  • 1M-token上下文窗口
  • 强烈的早期编码信号
  • 文本和图像输入
  • 具有竞争力的独立指数结果

需要谨慎的原因

  • 仅在发布时支持 Max 推理
  • $15/M 输出令牌
  • 此处未验证任务级可靠性
  • 捕获时未公布体重和技术报告

Kimi K3 的局限性及发布当日的注意事项

在购买 K3 之前,最需要了解的一点是:它专为专业级工作而优化。 “最大推理能力”功能始终处于开启状态,且固定的采样控制使得您在调整速度、成本和响应风格方面的余地较小。对于调试或研究而言,这是一种合理的权衡。但对于大规模分类、简短的重写,或是那些长篇回答大多属于冗余的任务来说,这种配置则有些大材小用。.

输出是成本中较为昂贵的一环。 按每百万输出代币 $15 的成本计算,一个会“大声思考”的模型很快就会变得非常昂贵。但这未必是致命缺陷:如果能为工程师节省一个下午的时间,那么几美分或几美元的成本可能微不足道。不过,这确实意味着在设定预算之前,你应该综合考虑每周运行的任务的输入和输出成本。.

第三,截至证据提交日,K3的开放式重量方案仍处于承诺阶段。Moonshot表示,完整重量数据将于2026年7月27日前公布,届时还将提供更多技术细节。7月17日核查时,官方 Moonshot AI Hugging Face 组织 未列出 K3。在代码库、许可证、模型卡和文件正式上线之前,“计划发布开放重量版”这一表述比“可供自行托管”更为准确。”

截至7月17日查询时,Moonshot AI尚未在其Hugging Face官方组织页面上发布Kimi K3的权重文件。.
该启动 API 仅支持最大推理,固定了采样设置,并提示网络搜索功能正在更新。.

需注意的首发日限额

  • 该 API 仅支持最大推理次数,且采样设置为固定值。.
  • 输出成本可能会主导一个冗长的推理工作流。.
  • 官方网络搜索工具已被标记为已更新。.
  • 某项产品功能或第三方集成并不一定自动成为基础型号的标准配置。.

Kimi K3 价格

Moonshot于2026年7月17日公布了Kimi K3 API的定价:每百万次缓存命中输入令牌为$0.30,每百万次未缓存输入令牌为$3,每百万次输出令牌为$15。 上下文窗口为 1,048,576 个令牌。这些是官方 API 标价,不含税及任何第三方提供商的加价。.

Kimi K3 每百万个令牌的计算成本为:缓存输入 $0.30,未缓存输入 $3,输出 $15。.

官方 API 每百万代币的定价

$0.30缓存命中输入
$3.00缓存未命中输入
$15.00输出

成本主要取决于产出

计算很简单:按相应的缓存速率计算输入令牌,再加上每百万个输出令牌消耗 $15。一个包含 100,000 个未缓存输入令牌和 10,000 个输出令牌的请求,其消耗量约为 $0.45。 一份包含200,000个令牌且有5,000个输出令牌的报告,其消耗约为$0.675。 包含 100 万个未缓存输入令牌和 50,000 个输出令牌的请求,其计算结果约为 $3.75。这些只是算术示例,并非来自私有测试运行的实际账单。.

API 成本示例

要求估计费用
100K 未缓存输入 + 10K 输出$0.45
200K 未缓存输入 + 5K 输出$0.675
1M 未缓存输入 + 50K 输出$3.75
基于官方标价的计算示例;不含税费及供应商加价。.

消费者访问权限和API访问权限属于不同的购买项目

消费者套餐、直接 API 账户和第三方多模型订阅分别适用于解决不同的问题。对于聊天和文件处理,消费者套餐通常是更简便的选择;API 则适用于构建工作流和跟踪令牌。套餐权益和区域可用性会发生变化,因此在将首发价格视为永久优惠之前,请先确认您打算采用的方案。.

选择该作业的通行路线

消费者套餐 通常是进行聊天和文件传输的最简单途径。. API 用于构建和衡量工作流。. 多模型工作区 当您希望在不同模型之间比较相同的实际任务时,这会非常实用。可用性和配额可能会因套餐和区域而异。.

在哪里可以试驾Kimi K3?

您可以通过 Moonshot 的消费级产品或 API 评估 K3,具体取决于各渠道的可用性和使用限制。 如果您实际想了解的是“哪个模型最适合处理这项任务?”,那么多模型工作区可能是相对省事的入门方式:使用相同的代表性提示词和文件,然后直接比较结果,而无需为每个模型重新构建 API 配置。.

试用 Kimi K3(GlobalGPT) 如果您想在一个工作区中将其与其他可用模型一起进行测试。这是一种访问选项,并不意味着每个套餐都包含所有 K3 功能,也不意味着它可以替代用于开发的直接 API。.

评估Kimi K3的方法
  • 面向日常聊天和文件处理工作流的“登月计划”级消费类产品。.
  • 用于开发、代币追踪和自定义集成的 Moonshot API。.
  • 一个多模型工作区,用于在现有模型中比较一项代表性任务。.

谁应该将基米·K3列入候选名单?

K3 非常适合经常处理复杂源材料或大型项目的研究人员、分析师和开发人员。此外,对于图表较多的报告和办公工作,当任务要求足够具体、需要通过实际推理而非简单套用模板来完成时,K3 也值得一试。.

如果您的首要考虑是将令牌成本降至最低、为日常工作寻找一种轻量级模式,或者希望立即实现自托管权重,那么建议您另寻他法。对于其他用户而言,K3 则是一个极具吸引力的新选择:给它分配一个实际任务,将结果与您已信赖的工具进行对比,看看额外的推理过程是否值得等待。.

最终结论

Kimi K3 是今年最引人注目的新产品之一。早期的独立数据和 WebDev 信号印证了 Moonshot 的说法,而 1M 的上下文窗口则为其提供了明确的实用价值。从编码、研究和处理长文档入手——这些正是其设计最能发挥作用的领域。.

K3 并非适用于所有提示词的最佳选择,其定价也不同于普通聊天模型。但如果工作任务足够复杂,需要一个能花时间思考的模型来处理,那么它就值得成为你工具箱中的一员。 最简单的判断方法是,给它分配那种通常会拖慢团队效率的任务,并将结果与你当前使用的模型进行对比。.

如果你想用更简单的方法来比较实际穿着效果,, 参见 GlobalGPT 方案 并将同一实际任务在您可用的模型上进行运行。.

常见问题

什么是Kimi K3?

Kimi K3 是 Moonshot AI 的旗舰推理模型,于 2026 年 7 月 16 日发布。 Moonshot表示,该模型总参数数为2.8万亿,可调用896位专家中的16位,支持文本和图像输入,并支持1,048,576个令牌的上下文窗口。.

Kimi K3 是开源的还是开放重量的?

Moonshot AI 表示,K3 的完整权重将于 2026 年 7 月 27 日前发布。7 月 17 日经查,Hugging Face 官方组织中尚未列出 K3。在代码库和许可证发布之前,“计划发布开放权重”是最准确的表述。.

Kimi K3的价格是多少?

7月17日记录的官方API价格为:每百万个缓存输入代币$0.30,每百万个未缓存输入代币$3,每百万个输出代币$15。税费、服务商加价、配额以及区域定价可能会影响最终成本。.

我可以免费试用 Kimi K3 吗?

Kimi的消费者定价页面显示,7月17日推出了免费的Adagio套餐,此外,K3也可通过付费或配额制方式获取。免费服务可能受地区、容量和使用配额的限制,因此不应将其视为无限量服务。.

Kimi K3 真的支持 1M 个令牌的上下文窗口吗?

是的。官方的快速入门和定价页面中列出了1,048,576个令牌的上下文窗口。这是上下文容量的上限,并不保证每个长篇文档的回答都准确或引用完整。.

Kimi K3 能分析 PDF、图表和电子表格吗?

K3 支持文本和图像,而 Moonshot 则针对电子表格和可视化代理基准测试报告结果。本评测未对 PDF、图表或电子表格进行任务级验证,因此用户应自行核对具体数值、页码引用、图例、公式以及遗漏的行。.

Kimi K3 适合用于科研和办公吗?

现有基准测试结果表明,K3值得纳入研究和办公工作的候选名单,尤其适用于长篇文档和结构化分析。但目前尚未验证其在特定工作流程中的引用准确性、多文件处理的可靠性以及输出质量。.

我可以在《Codex》中使用Kimi K3吗?

Moonshot 发布了一份 Codex 集成指南,介绍如何使用 CC Switch 将 Codex Responses API 流量转换为 Kimi Chat Completions。由于 CC Switch 是第三方软件,因此各组织在将其用于机密仓库或文档之前,应先审查其数据流向和安全要求。.

Kimi K3 和 Kimi Work 之间有什么区别?

Kimi K3 是该模型。Kimi Work 是一个将模型与文件、工具、浏览器操作、Office 文档创建、计划任务及其他工作流功能相结合的产品环境。Kimi Work 中展示的功能并不一定自动成为普通 K3 API 调用的功能。.

分享帖子:

相关帖子