NEXT AI EDITORIAL
GPT-6 Astra 的 ARC-AGI-3 到底是 62.7% 还是 99.9%?基准口径解析
ARC Prize 同时验证了 GPT-6 Astra 的 62.7% 与 99.9%:两者使用不同 harness。本文解释测试框架、成本、推理设置和正确比较方法。

文章目录
GPT-6 Astra 在 ARC-AGI-3 上既可以说是 62.7%,也可以说是 99.9%,但两者对应不同测试框架:ARC Prize 的标准 harness 得到 62.7%,保留模型不透明推理状态并自动压缩上下文的 Provider Adapter harness 得到 99.95%。真正的问题不是哪个数字“造假”,而是比较时是否使用了相同脚手架、预算和推理设置。
要点速览
- ARC Prize 官方结果页同时列出 62.71% 与 99.95%,两者都属于已验证结果。
- 62.71% 来自标准 harness 的 max reasoning;99.95% 来自 Provider Adapter harness 的 high reasoning。
- Provider Adapter 会保留跨请求的内部推理状态并进行上下文压缩,标准 harness 只允许模型携带自己选择的笔记。
- OpenAI 发布页突出展示 99.9%,容易让读者忽略框架差异;ARC Prize 并未据此宣布已经实现 AGI。
- 对开发者而言,结论反而很实用:模型能力取决于模型权重,也取决于记忆、工具、上下文管理和任务循环。
62.7% 和 99.9% 分别从哪里来
ARC Prize 的 GPT-6 Astra 结果页 给出了 12 组 harness 配置。标准框架下,Astra 在 max reasoning 的最佳成绩为 62.71%,测试成本约 26,098 美元;Provider Adapter 框架下,high reasoning 的最佳成绩为 99.95%,成本约 18,817 美元。
ARC-AGI-3 不是普通问答题,而是一组陌生交互环境。模型需要观察画面、尝试动作、从反馈中总结规则,再完成目标。测试框架决定它每一步能看到什么、能否保留之前的推理状态、上下文超长时怎样压缩。因此,同一模型在不同 harness 下出现巨大差距,在技术上完全可能。
harness 到底改变了什么
标准 harness 允许模型在环境推进过程中主动保留笔记。这更接近一个透明、厂商中立的代理循环:模型能留下显式信息,但不能把所有内部状态原样带到下一次请求。
Provider Adapter 则保留不透明的推理状态,并为长对话使用压缩,使模型可以跨请求复用更多此前工作。按照 ARC Prize 对 Astra 的官方分析,两种框架都达到了该模型在 ARC-AGI-3 上的最佳水平,但它们测量的不是完全相同的系统。
可以把它理解成同一个运动员参加两次比赛:一次只允许携带自己写下的公开笔记,另一次可以让私人教练保留完整战术板并在回合间整理。运动员相同,比赛支持系统不同,成绩自然不能直接放在同一列里解释。
为什么 99.9% 引发争议
OpenAI 的 GPT-6 Astra 发布页 使用“ARC-AGI-3 达到 99.9%”作为旗舰指标之一,并在脚注中说明使用了 Provider Adapter。问题在于,普通读者更容易看到主数字,而忽略脚手架并非所有对比模型都一致。
The Next Web 的调查报道 因此质疑:当同一个模型在厂商适配框架下为 99.9%,在标准框架下为 62.7% 时,主标题只写前者会制造“模型单独饱和基准”的印象。报道还指出,发布后部分公开指标发生修订,更说明读者应保存测试版本和口径,而不是只转述发布会数字。
需要保持两点平衡。第一,99.95% 不是凭空编出的数字,它在 ARC Prize 官方结果中可查。第二,它也不能脱离 Provider Adapter 被解释成“裸模型能力”。更准确的表述应是:“GPT-6 Astra 与 OpenAI 适配 harness 组成的系统,在该配置上达到 99.95%;同一模型在标准 harness 下最佳为 62.71%。”
这是否证明或否定 AGI
都不能。ARC Prize 官方更强调 Astra 在陌生环境中的学习能力和动作效率,其中一个强信号是:Astra 在 96% 的关卡上用比受测人类中位数更少的动作完成任务。但单一基准仍无法覆盖开放世界规划、事实可靠性、长期自主性、社会判断和安全控制。
中文同行内容在 9 月 6 日普遍强调“99.9%”“AGI 时代”和模型全面跃升,也有实测文章把前端生成、代码审查和长任务体验作为主要证据。这些内容抓住了搜索热度,但常见缺口是没有把标准 harness 与厂商 harness 拆开。理解发布与实测背景,可参考站内 GPT-6 Astra 全量开放与额度指南 和 9 月 4 日四大模型进展汇总。
普通用户该怎样读 AI 基准
检查下面六项,比记住排行榜更重要:
- 是否由同一机构、同一时间运行;
- 模型版本和快照是否固定;
- harness、工具、记忆和上下文压缩是否相同;
- reasoning effort、采样次数和预算是否一致;
- 分数是单次最好成绩、平均值,还是多次通过率;
- 成本、延迟、人工介入和失败案例是否公开。
如果这些字段不同,就把结果视为“系统演示”,不要当成严格横评。团队采购模型时,还应在自己的代码库、文档、客服或研究任务上做盲测,并记录成功率、总成本和返工次数。
这场争议对智能体开发有什么价值
它提醒开发者,harness 不是无关紧要的包装。显式笔记、隐藏状态续接、上下文压缩、工具权限、错误重试和停止条件,都会决定代理能否完成长任务。换模型之前先审视运行框架,往往比把模型名替换成最新版本更有效。
同时,越强的状态保留也带来越高的审计难度。团队需要记录输入、工具调用、状态摘要、模型版本和关键决策依据,否则高分系统到了生产环境,仍可能无法解释为什么成功或失败。与安全治理相关的实践可继续阅读 AI Agent 权限安全指南。
总结
62.7% 与 99.9% 都是真的,但它们测的是两套不同的“模型 + harness”系统。最稳妥的结论不是宣布 GPT-6 Astra 已经或尚未达到 AGI,而是承认运行框架对智能体能力的贡献巨大。以后看到任何 AI 基准,先核对脚手架、推理设置、预算和版本,再比较数字。
FAQ
GPT-6 Astra 的 ARC-AGI-3 官方成绩是多少?
ARC Prize 官方列出多个配置:标准 harness 最佳 62.71%,Provider Adapter harness 最佳 99.95%。
Provider Adapter 是不是作弊?
不能简单称为作弊。它是公开说明并被官方结果页记录的测试配置,但与标准 harness 不同,因此不能省略框架差异后直接横向比较。
99.9% 能证明 GPT-6 Astra 是 AGI 吗?
不能。它证明特定系统配置在一个基准上表现极强,不足以覆盖通用智能、安全性和现实世界长期任务。
企业应该相信哪个分数?
把两者都当作参考,并在自己的任务、预算和工具框架中复测。实际一次通过率、成本、延迟与返工更能支持采购决策。
Article JSON-LD
{"@context":"https://schema.org","@type":"Article","headline":"GPT-6 Astra 的 ARC-AGI-3 到底是 62.7% 还是 99.9%?基准口径解析","description":"解释 GPT-6 Astra 在 ARC-AGI-3 上 62.7% 与 99.9% 两个官方成绩的 harness、推理设置、成本和正确解读方式。","keywords":"GPT-6 Astra,ARC-AGI-3,99.9%,62.7%,AI基准,harness,AGI测试,OpenAI基准争议","datePublished":"2026-09-07","dateModified":"2026-09-07","mainEntityOfPage":"https://next.ccgzs.xyz/blog/gpt-6-astra-arc-agi-3-harness-score-explained","publisher":{"@type":"Organization","name":"NEXT AI","url":"https://next.ccgzs.xyz"}}
FAQPage JSON-LD
{"@context":"https://schema.org","@type":"FAQPage","mainEntity":[{"@type":"Question","name":"GPT-6 Astra 的 ARC-AGI-3 官方成绩是多少?","acceptedAnswer":{"@type":"Answer","text":"ARC Prize 官方列出多个配置:标准 harness 最佳 62.71%,Provider Adapter harness 最佳 99.95%。"}},{"@type":"Question","name":"Provider Adapter 是不是作弊?","acceptedAnswer":{"@type":"Answer","text":"不能简单称为作弊。它是公开说明并被官方记录的测试配置,但与标准 harness 不同,比较时必须标注框架差异。"}},{"@type":"Question","name":"99.9% 能证明 GPT-6 Astra 是 AGI 吗?","acceptedAnswer":{"@type":"Answer","text":"不能。它只证明特定系统配置在一个基准上表现极强,不能覆盖通用智能、安全性和现实世界长期任务。"}},{"@type":"Question","name":"企业应该相信哪个分数?","acceptedAnswer":{"@type":"Answer","text":"两者都可参考,但应在自己的任务、预算和工具框架中复测,以一次通过率、成本、延迟和返工作决策。"}}]}