Qwen 3.8 Max 是阿里巴巴 Qwen 专为编程、专业工作、长期运行的代理以及多模态任务打造的新款旗舰机型。其正式名称为 Qwen3.8-Max, 该模型于2026年8月3日发布,拥有2.4万亿个总参数、950亿个活跃参数,以及100万个令牌的上下文窗口。.
此次发布远不止是一次例行的基准更新。Qwen将该模型定位为一种能够进行规划、使用工具、分析视觉反馈,并在漫长的任务链中持续工作的智能代理——而不仅仅是一个每次只回答一个提示的聊天机器人。这使其在销售话术中与 最适合实际工作的AI模型, ,但在切换之前,其API定价、不限流量套餐以及部署要求都值得仔细研究一番。.

什么是 Qwen3.8-Max?
Qwen3.8-Max 是由阿里巴巴 Qwen 团队构建的一个大型专家混合模型。该模型总参数数达 2.4 万亿,但每个令牌仅激活 950 亿个参数。 该模型将文本、代码、视觉理解、工具使用和长远规划整合到一个系统中,旨在从头到尾完成复杂的工作。.
"(《世界人权宣言》) Qwen官方发布 阐述了四个核心目标:更强大的自主编码能力、达到生产级质量的专业交付成果、更长的闭环任务,以及原生多模态智能体。 具体而言,Qwen希望模型能够从“回答这个问题”转变为“接受这个目标,制定计划,使用可用工具,检查结果,并持续执行直至任务完成”。”

Qwen 3.8 最大规格
参数数量需要结合上下文来理解。一个拥有2.4万亿个参数的模型规模确实庞大,但Qwen3.8-Max并非对每个令牌都使用所有参数。其“专家混合”设计会将每个令牌路由到网络中较小的一部分活跃区域。 因此,与单纯的总参数数相比,950亿个活跃参数这一数字对于理解推理行为更为有用,尽管这两个数字本身都无法直接反映实际延迟或硬件需求。.
100万个令牌的上下文窗口更具实际应用价值。它可以在单次请求中容纳大型代码库、长篇文档集、扩展的代理历史记录或长达数月的运营记录。虽然这不能保证每个令牌都能被完美检索,但它为开发人员提供了更大的空间,使其无需进行激进的裁剪,即可保留指令、工具输出、代码和中间决策。.
Qwen3.8-Max 能做什么?
自主编码
Qwen的发布资料着重强调了那些远不止于单次代码生成请求的项目。 该公司描述了一种持续超过10天的自主开发过程:从一个空文件夹起步,逐步构建出可投入生产使用的项目,同时能够适应各种错误和新需求。这对仓库级智能代理而言是正确的方向,不过买家仍应根据自身使用的编程语言、测试套件、安全规则和部署环境对该模型进行验证。.
对于日常工程工作而言,实际问题要简单得多:模型能否同时处理多个文件?重构时能否保留接口?它能否编写测试用例、排查故障并修正自己的补丁?在选择时,这些标准比排行榜上的单个分数更为重要。 最适合编码的人工智能模型.
专业“协同办公”任务
“cowork”一词指的是工作成果,而非闲聊。Qwen 重点关注数百个专业领域中的报告、研究、演示文稿、分析、文档及其他交付成果。 一个优秀的“cowork”模型需要遵循任务说明、整理证据、采用正确的格式,并产出可供他人编辑或交付的成果——而不仅仅是一段看似合理的文字。.
长时域代理
Qwen 还报告了持续数百轮的系统级任务。 其示例包括超过 500 轮的芯片设计优化以及为期一年的电子商务战略模拟。这些是供应商的演示,并非承诺每个代理都能在无人干预的情况下运行数天。但它们确实展示了该产品的目标方向:持续规划、闭环评估和反复改进,而非孤立的答案。.
多模态规划与视觉反馈
Qwen3.8-Max 将图像和屏幕视为智能体循环的一部分。视觉智能体可以检查页面、选择操作、观察发生的变化,并调整其计划。这支持计算机操作任务、文档理解、界面测试、可视化编码、图表分析以及空间推理。 难点不仅在于识别图像,更在于让视觉观察结果在多个步骤中始终与智能体的目标保持关联。.
实际测试:有用的输出、响应缓慢以及一次空运行
我对该系统发起了三个独立的请求, qwen3.8-max 将于 2026 年 8 月 4 日通过兼容 Anywhere OpenAI 的 API 获取模型 ID。这些只是些简短的实用性检查,并非独立的基准测试,也不代表对所有 Qwen 部署情况的断言。它们之所以有用,是因为既能体现可见答案的质量,又能反映被测试网关路径的行为表现。.
Retry-helper 调试
第一个任务使用了来自支付 Webhook 场景中一个已损坏的重试函数。提示词将模型限制为三次尝试、两次精确的退避延迟、成功后立即返回,以及在完全失败后重新抛出第三个异常。.
该答案指出了三个独立的缺陷:每次尝试后都会无条件进入睡眠状态,一个未分配的 结果 在处理完异常之后,还进行了一次“真值性”检查,该检查导致成功情况被延迟或处理不当。其预期的输出应为 "使用 sleep_fn 参数 [0.1, 0.2] 进行"支付”.
随后,我没有轻信那段解释,而是直接在本地运行了这段代码。它通过了三个测试用例:先是两次失败,随后一次成功;第一次调用返回了一个假值,但结果却成功了,该值为 0, ,以及三次失败,其中最后一次 RuntimeError("failure-3") 不得不重新发起请求。这是一个很好的工程解决方案。其代价是延迟:通过测试网关,可见响应耗时51.577秒。.
矛盾证据的综合分析
第二项任务旨在测试该模型能否将最新的官方事实与旧笔记、供应商声明、社区评论以及未经核实的平台路线区分开来。.
该模型正确处理了人为制造的冲突。 它没有将256K上下文或$1.20的输入价格重复为当前值,没有将“四张GPU”的评论转换为硬件要求,也没有声称GlobalGPT已经拥有专用的Qwen3.8-Max路径。 此外,它还将官方基准测试表标注为“厂商报告”。响应耗时94.973秒,因此这又是一个“质量优先”的结果,而非追求速度的快速提取结果。.
规划测试中哪里出了问题?
第三个请求要求制定一份为期两小时、由两名工程师负责的CMS迁移计划,其中需明确规定“执行/不执行”和“回滚”的决策点。第一个请求在上游连接关闭后,于133.682秒时结束。一个较短的重试集 max_completion_tokens 为 1,200,但 API 报告称 finish_reason: "长度", ,耗尽了全部推理预算,并在32.899秒后未返回任何可见结果。.
这是一个有用的运行警告,但并不能证明 Qwen3.8-Max 无法规划迁移。由于没有可评分的计划,因此无法进行评分。通过此网关,复杂的规划需要更大的完成余量、流式处理或分阶段提示,以确保在输出可见文本之前,内部推理不会耗尽整个响应预算。.
Qwen 3.8 最高基准测试
Qwen的官方基准测试包将Qwen3.8-Max呈现为一款强大的编码和多模态智能体,但测试结果喜忧参半,并未全面胜出。 它在某些测试中领先于所列模型,在其他测试中紧随领先者,而在若干类别中则落后于 GPT-5.6 Sol 或 Fable 5。这种评估结果比将数十项测试简化为一个“最佳模型”标签更为客观。.

Qwen官方赛程表中的部分赛果
这些数据来自Qwen发布的资料。 脚注显示,该表格综合了官方机型报告、系统卡、公开排行榜以及Qwen的内部评估结果。部分机型的配置和设置也存在差异。请参考该表格识别具有潜力的优势,并在做出高成本决策前,通过实际操作验证候选名单。.

编码结果的含义
最明显的优势在于均衡性。Qwen3.8-Max 在终端操作、软件工程、论文实现、协同办公任务、网络搜索以及遵循指令等方面均位居前列。 它无需在每一项测试中都获胜就能发挥作用;一个在规划、编码、工具使用和视觉检查等方面表现始终强劲的智能体,可能比针对某一项狭窄测试进行优化的模型更值得信赖。.
该官方表格还展示了为何并行测试至关重要。GPT-5.6 Sol 在多项推理或终端导向型测试中名列前茅,而 Fable 5 在协作、交互和视觉任务中仍表现尤为出色。另一份 GPT-5.6 与 Fable 5 的对比 在将 Qwen3.8-Max 列入候选名单之前,这可以帮您将这些型号系列与实际应用场景对应起来。.
多模态结果的含义
Qwen3.8-Max 在多模态推理、视觉定位、计算机操作、文档处理和空间理解方面取得了优异的官方成绩。它在 OSWorld-Verified 数据集上获得的 86.1 分对屏幕操作型智能体尤为重要,因为该指标衡量的是在桌面环境中完成任务的能力,而不仅仅是描述图像。.

Qwen3.8-Max 的对比分析
对于“Qwen3.8-Max 是否优于 GPT、Claude 或 Gemini?”这个问题,无法给出一个负责任的简短答案。Qwen 的自有数据显示,各分类的领先者逐行都在变化。 产品的适用性还取决于工具的可靠性、输出质量、延迟、区域可用性、隐私控制以及围绕该模型的交互界面。.
当您希望仅凭一个模型就能覆盖编码、文档处理、研究、长期任务以及视觉代理等场景时,Qwen3.8-Max 显得最具吸引力。对于那些其最强的推理能力及最终结果能直接迁移到您工作环境中的任务,GPT-5.6 Sol 可能仍是更优的选择。 对于协同工作和界面密集型任务,Fable 5 值得进一步关注;该 Fable 5 与 Opus 4.8 的对比 对此部分的裁决提供了更多背景信息。.
该模型计划采用的开放权重可能成为其最大的结构优势。虽然目前仅支持API的性能很重要,但可下载的权重为微调、私有基础设施、研究和区域部署提供了更多选择。其最终价值将取决于发布的许可证、权重格式、量化支持以及以实用速度运行该模型所需的硬件。.
Qwen3.8-Max API 定价
Qwen在其报告中列出了以下首发价格: 官方公告:
一个简单的估算方法是:
估计成本 = 未缓存输入 × $2/M + 缓存输入 × $0.25/M + 输出 × $6/M
例如,使用1000万个未缓存的输入令牌和200万个输出令牌进行的一次运行,在其他平台收取费用之前,按上线时的费率计算,成本约为$32:输入部分为$20,输出部分为$12。 一个在每个回合都会重新读取大型存储库的代理,其消耗可能会高得多,这使得缓存和上下文管理与输入价格本身同样重要。.

Qwen3.8-Max 还支持 推理_努力 控件。官方 API 部分列出了 xhigh 作为复分析的默认设置,, 中等 为了在精度和速度之间取得平衡,并且 低 以便更快、更高效地工作。. preserve_thinking 默认情况下已启用。这些控制措施可以降低成本,但应针对任务质量进行测试,而非将其视为可互换的模式。.
跨服务商定价同样需要谨慎对待。即使某种模式的代币单价较低,但如果需要更长的提示词、更多重试次数或额外的工具调用,其成本仍可能更高。该 Gemini 3.1 Pro API 定价指南 这是一个很好的例子,说明了为什么除了基础率之外,上下文长度和使用层级也至关重要。.
如何访问 Qwen3.8-Max
1. 使用 Qwen Studio 进行直接评估
最快实现“初次见面”的方式是 Qwen 工作室. 不要从琐碎的提示开始,而应从实际任务入手:提供一份杂乱无章的任务说明、涉及多个文件的编码问题、一组文档,或者基于图像的工作流程。检查结果是否准确、可编辑且足够完整,以节省时间。.
2. 在应用程序中使用 QwenCloud API
Qwen3.8-Max 可通过以下途径购买: QwenCloud. 发布页面指出,其 API 支持符合行业标准的聊天完成和响应协议,这些协议与 OpenAI 规范兼容,此外还提供了一个与 Anthropic 兼容的接口。这使得迁移更加便捷,但您仍应查阅官方文档中关于模型名称、参数、流式处理行为、工具模式以及错误处理的相关内容。.

3. 将其与编程和代理工具连接起来
Qwen 的发布页面列出了与 Qwen Code、Claude Code、Codex 和 OpenClaw 的集成方案。因此,该模型可无缝融入现有的终端或代理工作流,无需强制开发新接口。 集成支持并不能消除相关工具的成本,因此请将该模型的账单与单独的 Codex 定价结构 在将团队工作流程标准化之前。.
Claude 代码用户还应将编码产品的成本与外部模型 API 的成本区分开来。可用的套餐和计费路径汇总在 Claude 代码定价指南.
OpenClaw的用户还有一个问题:对于特定的代理,哪种型号在工具使用、速度和价格方面能提供最佳的平衡。该 OpenClaw 模型比较 为做出这一选择提供了一个实用的框架,而不是默认选择最大的模型。.
4. 确保多模型工作流的可靠性
在发布之初,QwenCloud 是 Qwen3.8-Max 的经验证的生产路线。如果您还对比 GPT、Claude、Gemini 或 Fable 的替代方案,那么 GlobalGPT 多模型工作区 可以减少在支持的各机型之间切换标签页的次数。在确认专门的 GlobalGPT 机型页面之前,请使用 Qwen3.8-Max 的官方 Qwen 路径;不要因为该机型已发布就假设存在新的机型网址。.
Qwen3.8-最大开放重量
Qwen宣布,Qwen3.8-Max权重将在8月3日发布后的那一周内发布。同样地 官方X平台帖子 还表示 Qwen3.8-27B 将转为开放重量级。这对本地部署和研究来说是个好消息,但仅凭这一公告还不足以规划一个生产集群。.
在下载硬件或制定硬件预算之前,请核对最终型号卡上的以下五项内容:
- 具体的许可条款和商业使用条款。.
- Hugging Face 或 ModelScope 的官方代码库网址。.
- 可用的精度和量化格式。.
- CPU、GPU、内存和存储空间的最低及推荐配置要求。.
- 发布的模型是否与托管 API 的行为和上下文长度相匹配。.
“开放权重”和“开源”并不总是同义词。 “开放权重”意味着模型参数可供下载;而许可协议则决定了您可以进行哪些修改、再分发或商业使用。在代码库和许可协议正式发布之前,那些承诺提供Qwen3.8-Max下载、GGUF构建版本或具体本地硬件要求的页面,都属于言之过早。.
27B版本的发布也应采取同样的处理方式。它或许会成为本地用户更现实的选择,但其架构、上下文长度、内存需求和基准测试分数应来自其自身的官方型号卡,而非照搬自Max型号。.
Qwen3.8——最大限制与最佳拟合
需要考虑的局限性
- 大多数发射证据来自Qwen。. 独立评估可能会采用不同的提示、工具或评分规则。.
- 长上下文并不等于完美的记忆。. 一个模型即使能处理100万个令牌,也可能遗漏某个细节,或者未能严格遵循某条不明确的指令。.
- 输出密集型代理可能会变得成本高昂。. 当工作流生成长代码、报告或重复的推理跟踪时,每百万次$6的输出率就显得尤为重要。.
- 在权重和模型卡送达之前,本地部署的详细信息尚不完整。. 一个2.4T全参数系统的工作方式不会像小型台式机模型那样。.
- 工具的使用又增加了一层失败的可能性。. 浏览器状态、权限、网络错误以及定义不明确的工具模式,都可能导致原本性能良好的模型失效。.
- 发布信息变化很快。. 在发布或采购之前,应再次核对价格、存储库、集成情况及可用性。.
现在谁应该试试呢?
简单来说,Qwen3.8-Max 值得进行认真的测试,但不应盲目迁移。应选用一个要求严格的任务(需明确成功条件),记录总令牌数和重试次数,并比较最终的输出结果——而不仅仅是第一个答案。.
常见问题
Qwen 3.8 Max 是何时发布的?
Qwen3.8-Max 于 2026 年 8 月 3 日正式发布。 该托管模型在发布之初即通过 Qwen Studio 和 QwenCloud 提供。Qwen 表示开放权重将于下周发布,因此 API 的可用性和可下载权重的可用性应视为两个独立的里程碑。.
Qwen3.8-Max 是开源的吗?
Qwen 已宣布发布 Qwen3.8-Max 的开放源代码版本,但最终的代码库和许可证将决定用户可以运行、修改、再分发或进行商业使用的范围。在相关文件正式发布并经过验证之前,称其为“已宣布发布开放源代码版本”比假设所有开源许可或本地格式均已可用更为准确。.
Qwen3.8-Max 有多少个参数?
Qwen3.8-Max 总参数数为 2.4 万亿,每个令牌激活 950 亿个参数。该模型采用专家混合架构,因此总参数数和活跃参数数分别描述了系统的不同部分。仅凭其中任何一个数值都无法预测实际运行速度或硬件需求。.
什么是 Qwen3.8-Max 上下文窗口?
官方发布文档中列出的上下文窗口大小为100万个令牌。这一规模足以容纳大量代码、文档、工具输出以及代理历史记录,但最大上下文长度并不能保证检索结果完美无缺。请根据您实际工作流中信息的位置、格式和密度对模型进行测试。.
Qwen3.8-Max API 的价格是多少?
上线时,Qwen 设定的费率为:每百万输入代币 $2、每百万输出代币 $6,以及每百万隐式缓存代币 $0.25。请将这些视为上线价格,并在制定预算前予以核实。 代理成本还取决于上下文复用、推理工作量、重试次数以及生成的输出长度。.
Qwen3.8-Max 是否比 GPT-5.6 Sol 或 Fable 5 更好?
并非在所有测试中都是如此。Qwen的官方数据表显示,Qwen3.8-Max在部分编码、搜索、执行指令和计算机使用等基准测试中表现领先,而GPT-5.6 Sol或Fable 5则在其他测试中表现更佳。 哪种型号更优,取决于任务类型、工具环境、延迟、价格以及最终交付成果的质量。.
我可以在本地运行 Qwen3.8-Max 吗?
Qwen 已公布发布后一周可下载的权重文件,但本地部署的可行性取决于最终文件、精度、量化支持、许可协议以及硬件指南。请等待官方模型卡发布后,再参考其对 RAM、VRAM 或存储空间的具体估算值。一旦官方文档发布,体积更小的 Qwen3.8 变体可能更具实用性。.
什么是 Qwen3.8-27B?
Qwen的发布帖中提到,Qwen3.8-27B也将以开放权重形式发布。Max的发布文章未提供足够细节,因此无法直接复用Max模型的规格参数来构建27B版本。 请查阅该模型的专用卡片,了解其架构、上下文窗口、基准测试、许可信息及下载说明。.
我可以在 GlobalGPT 上使用 Qwen3.8-Max 吗?
截至本文发布之时,尚未验证 Qwen3.8-Max 的专用 GlobalGPT 路线。 请使用 Qwen Studio 或 QwenCloud 进行直接访问。GlobalGPT 仍可用于在不切换平台的情况下,对比其他可用的 GPT、Claude、Gemini 和 Fable 模型。.
最终结论
请使用 Qwen Studio 或 QwenCloud 直接评估 Qwen3.8-Max。请使用 GlobalGPT 来比较其他经过验证的模型,但这并不意味着已经存在专用的 Qwen3.8-Max 路径。.
比较可选机型Qwen 3.8 Max 是 2026 年最具雄心的模型发布之一:总参数数达 2.4 万亿,活跃参数数达 950 亿,上下文窗口长度为 100 万个令牌,在编程和多模态智能体任务上均取得了强劲的官方测试结果,并宣布将采用开放权重路径。 其发布时的 API 定价极具竞争力,非常适合进行测试,尤其是当缓存机制能降低重复上下文成本时。.
值得关注的最大理由并非某次基准测试的胜利,而是试图将编码、专业交付成果、长远规划、可视化反馈以及工具使用整合到一个模型中。 不妨从 Qwen Studio 开始,或者进行一次受控的 QwenCloud 评估,衡量已完成任务的质量和总成本,并在获得官方权重和许可证之前,暂不承诺本地部署。.
2026年8月4日核查的一手资料: Qwen3.8-Max 正式发布 和 @Alibaba_Qwen 官方发布帖.



