模型比较首先要从具体任务入手:我们的要求是什么,输出结果是否满足这些要求?我们使用 GlobalGPT CLI 在 GlobalGPT 上对 AI 模型进行测试。相关文章中指出了例外情况。.
AI会检查输出内容是否存在错误以及是否符合提示要求。当输出内容通过这些检查后,我们会比较速度、价格以及(如适用)代币使用情况。作者还会评估一些主观因素,例如写作风格和视觉吸引力。音频评估完全由AI使用Gemini 3.6 Flash完成。.
我们是 GlobalGPT 评审团队, ,属于GlobalGPT的一部分。该方法论涵盖了我们在新机型发布时于博客中发布的测试内容,以及机型对比分析。基于GlobalGPT用户数据的研究报告会详细说明其数据集和分析方法。.
我们的测试环境:GlobalGPT CLI
GlobalGPT CLI 是我们的默认测试环境。如果测试使用的是其他接口、API 路径或原生编码工具,则需结合该环境来理解相关内容。不同环境下的模型名称、可用设置、工具及访问权限可能会有所不同。.
生成输出的模型与评估该输出的AI扮演着不同的角色。评估器的判断是对返回输出的一种佐证;它并不能说明被测试模型的内部工作原理。.
任务设计:提示、输入和要求
我们为模型分配具有明确要求的具体任务。写作任务可能要求仅根据提供的笔记撰写摘要;编程任务可能要求编写一个能够处理空输入的函数;图像处理任务可能要求海报上的文字表述完全准确。.
作为对比,提示词和输入材料确定了每个模型需要完成的任务。在解读结果时,支持的格式、设置或可用工具之间的差异至关重要。固定提示词的比较与通过多次尝试改进提示词的教程,所解答的问题各不相同。.
输出评估:错误、说明和效率
错误与及时遵守
AI 会评估输出结果是否符合任务要求,以及是否包含可识别的错误。相关检查可能包括计算错误、缺乏依据的论断、字段缺失,或未遵循规定的格式。.
“通过”表示所执行的检查未发现任何错误。. 这并不能保证输出结果完全没有可能出现的任何错误。AI评估人员可能会忽略错误或做出错误判断。.
执行情况是评估中的一个独立部分。在我们的 Kimi 编码计划测试, 生成的代码之后进行了五项局部检查。阅读代码、让模型检查其自身的答案以及运行测试,都能提供不同的证据。.
速度、价格和代币用途
一旦输出结果满足任务要求,效率就能帮助我们区分有用的选项。一个虽然快速但遗漏了必要计算的答案,其完成的工作量并不等同于一个正确的答案。.
| 度量 | 如何阅读 |
|---|---|
| 时间 | 请查看测量窗口。从请求到完成的时间包括相关的路由和处理过程;这并不一定等同于服务提供商侧的模型延迟。. |
| 代币用途 | 请使用该服务返回的类别。输入、输出、缓存或推理令牌数据缺失并不意味着使用次数为零。. |
| 费用 | 应区分已记录的 GlobalGPT 费用或退款与基于服务提供商 API 价格的估算金额。订阅费是另一项衡量标准。. |
| 媒体生成 | 请考虑输出设置以及适用的积分或按输出计费。代币计数可能不可用或没有实际意义。. |
价格估算需要明确的计算依据。如果没有经过验证的转换规则,就无法将积分转换为美元,而且仅凭一个值为零的响应字段,并不能证明该请求是免费的。.
主观任务的评分标准
作者们还会比较在偏好影响实用性时各成果的表现。对于写作或图像而言,这可能意味着要说明哪项成果的语言更清晰、版式更易读,或者构图更符合要求。.
我们的 Seedream 5.0 Pro 与 GPT Image 2 的对比 展示了针对特定任务的配对图片。清晰的文字说明和版式设计让读者能够结合作者的偏好进行观察。审美偏好与经过客观验证的要求仍有所不同。.
使用 Gemini 3.6 Flash 进行 AI 音频评估
我们的音频收听评估完全由人工智能完成。. 我们使用 Gemini 3.6 Flash 来分析实际音频。这些是人工智能评估结果,而非人工听评小组的测试结果。.
评估取决于任务:所需的语音、语言、声音事件、时序还是音乐结构。我们的 Seed Audio 1.0 评测 包括生成的音频以及对内容、事件、时间点和伪影的人工智能分析。.
文件属性(如格式和时长)与内容评判是分开的。音频轨的存在并不能证明所要求的词语或声音是正确的。任何已发布的乐谱都必须结合评价标准及其所描述的音频来解读。.
如何解读测试日期、设置和输出证据
详细的测试证据应放在单篇论文中。有用的背景信息包括:
- 测试日期、型号标识符和环境。.
- 任务、提示、输入材料和预期成果。.
- 可用设置、尝试次数及相关更改。.
- 评审人、所采用的评审标准,以及作者偏好的理由。.
- 实际输出结果或摘录、截图或媒体文件,以及可用的时间、使用情况和成本记录。.
不同文章和早期测试中的记录各不相同。缺失的测量数据无法作为已观测事实进行重建。模型集合页面的“博客与指南”部分提供了相关评测及本方法论的链接;完整的提示和输出证据仍保存在博客文章中。.
关于重试、请求失败和修订的解读
首次输出结果、选定结果以及修改后的尝试会向读者传达不同的信息。文章的尝试历史很重要,其中包括技术故障、空响应、不完整的答案,以及提示或设置的更改。.
一个成功的请求仍可能返回无法使用的响应。一个失败的请求可能揭示了被测路由存在的问题,但并不意味着该模型存在普遍缺陷。我们的文章采用不同的测试范围;每个结果背后并没有统一的测试次数或盲测流程。.
任务结果能告诉您什么、不能告诉您什么
一项结果可以支持关于被测试任务、模型、日期和环境的结论。仅凭小规模的任务集和个别计时测量结果,无法确立普遍适用的性能排名。如果比较中仅测试了一方,该证据便无法证明两个模型之间存在确定的胜者。.
官方规格、第三方基准测试、以往的测试结果以及文章本身的测试结果,都提供了不同类型的证据。任何评分都取决于其声明的评分标准、权重分配以及排除项。读者应能够将结论与证据联系起来,包括不完整的或未成功的测试结果。.
文章更新与模型重新测试有何不同
正如我们在……中所述,我们通常每两到四周对文章进行一次评审。 编辑标准. 内容检查并不意味着每个模型测试都已重新运行。.
更新价格、更正现有输出结果的评估以及生成新的输出结果是三项独立的操作。历史结果仍与其原始测试上下文相关联;仅凭文章更新日期较新,并不能使其成为新的测试结果。.



