GPT-6 Astra 深度分析:它真的达到 AGI 了吗?
先说结论
如果按 OpenAI 自己的定义——“高度自主,并在大多数有经济价值的工作上超过人类”——我的判断是:GPT-6 Astra 还不能被严格认定为 AGI。
但它也不只是“更会做题的大模型”。它把推理、浏览、软件操作、写代码和长任务衔接到了同一套系统里,已经很像一个能自己找资料、动手、检查结果的数字同事。更准确的定位是:前 AGI 级通用智能体,或者说“已经能干很多活,但还不能放心地把大多数活都交给它”。
官方发布页里,Astra 到底进化了什么
1. 从“给答案”跨到“把事做完”
发布页最重要的信息,不是某个考试又涨了几分,而是 Astra 把视觉理解、电脑操作和判断连了起来。它能填表、更新 CRM、做网络调研、分析数据、搭网站、做前端 QA,也能安装和排查软件。这类任务的答案不在一段文字里:模型必须观察环境、连续操作,还要知道什么时候该问人。
分数也证明这不是纯演示。Astra 在 BrowseComp 为 91.5%、BenchCAD 为 95.9%、ScreenSpot-Pro 为 92.7%,Agents’ Last Exam 为 59.3%。OSWorld 2.0 的离线子集是 72.6%,官方模拟中每任务约 40 分钟,GPT-5.6 Sol 则是 65.7%、约 75 分钟。这说明 Astra 的提升不只是更准,还有明显的任务时间和 token 效率改善。
但 OSWorld 72.6% 是“2026.08.08 离线集、部分分数”,酥悠沫榜单因此只展示、不计入排名。AutomationBench 虽以 41.4% 刷新官方对比中的最好结果,跨应用商业流程仍有近六成没做成。“能代办”已成立,“能无监督代办”还没成立。
2. 编程更强,但并没有统治编程榜
官方给出的编程分数是:Terminal-Bench 4.0 57.9%、DeepSWE 1.1 74.1%、FrontierCode Extended 64.5%、Main 53.3%,内部数据库迁移 63.9%。Astra 还能跨上下文窗口保存笔记、检索早期消息,减少长时间调试中因多次压缩上下文而丢细节。这不会让模型突然变聪明,却会让它在长任务中少忘事。
可酥悠沫榜单给出了一个很有价值的反差:Astra 的 Code 排名是 第 6/95,而不是第一。它在 Terminal-Bench 4.0 上是第 1/10,DeepSWE 是第 2/36,但 FrontierCode Main 只是第 3/13,Extended 是第 2/7,Terminal-Bench 2.1 是第 6/25,SciCode 更只到第 21/65。排在它前面的是 Claude Fable 5.1、Muse Spark 1.3、Claude Fable 5、Claude Mythos 5 和 Claude Opus 5。这说明 Astra 很擅长某些“终端里把任务做完”的场景,但在更广的科学编程、仓库修改和多套评测中,优势没有稳定到足以压过所有对手。
3. 科学和网络安全,是它最像“能创造新价值”的部分
Astra 在 FrontierMath Tier 4 v2 得到 97.6%,GPQA Diamond 96.0%,Terminal-Bench Science 64.6%。发布页还披露,它参与推进了两项素数间隔结果:一项把已知短间隔上界从 240 改进到 186,另一项改进了一个 80 多年未动的大间隔估计项。这已触及新知识生产,但稳妥说法仍是“帮助研究者得到新结果”,不是“可独立替代数学家”。
网络安全的跃迁更陡。ExploitBench 是 100%;在 2026 年 6—8 月新漏洞组成的内部集上,任意代码执行成功率为 39.0%,评测中还发现并利用了两个未知零日漏洞。SRE-Bench 单次成功率是 88.0%,四次内 99.2%。系统卡将它的网络安全能力定为 Critical。这既是能力证据,也是风险证据:会自己找新漏洞的系统,必须受权限、监控和人类确认约束。
酥悠沫榜单告诉我们:它很强,但“第一”有严格边界
我按本站当前排名代码复算后,Astra 的位置是:
| 榜单 | 排名 | 命中有效 bench | 与共同对手的战绩 |
|---|---|---|---|
| 综合 Overall | 1/93 | 25/81 | 90 胜 1 平 1 负 |
| General | 1/90 | 17/56 | 87 胜 1 平 1 负 |
| Code | 6/95 | 8/25 | 71 胜 1 平 3 负 |
这个榜单不是把所有缺失分数当成零分,而是只在两个模型都有成绩的 benchmark 上两两对局。因此,综合第一的准确含义是:Astra 在已测的共同项目上,击败了几乎所有对手。它不表示 Astra 完成了 81 项测试,更不表示它已覆盖了“大多数经济工作”。Astra 数据行里原始分数很多,但只有 25 个进入当前 Overall 有效集合,覆盖率是解读第一名时不能省掉的分母。
它真正好的地方很集中:GPQA、MMMU-Pro、Agents’ Last Exam、BrowseComp、Terminal-Bench 4.0、ARC-AGI-3、FrontierMath T4、BenchCAD 和 ExploitBench 都拿到第一。这条能力链横跨难题理解、信息搜寻、屏幕操作、工具使用和结果交付,是它比以前的强问答模型更接近 AGI 的核心原因。
它的短板也很具体:AutomationBench 第 12/31、τ3-Banking 第 14/49、HLE with tools 第 11/47、AA-LCR 第 27/57、SciCode 第 21/65。Artificial Analysis Intelligence Index 是 61.2,只排第 4/7;独立测评中与 GPT-5.6 Sol 基本持平,比 Claude Fable 5.1 低约 5 分。GDPval-AA v2 还约回退 80 Elo,τ3-Banking、SciCode 和 AA-LCR 也有回退。这些项目更接近银行流程、长文本、专业交付和稳定编程:Astra 上限很高,下限还没有高到“随手交给它都稳”。
为什么 99.9% 的 ARC-AGI-3 仍不能一锤定音
这是最容易被误读的数字。ARC Prize 的验证页 显示,同一模型在标准 harness 下的最好成绩是 62.7%,使用能保留不透明推理状态、支持长程压缩的 Provider Adapter 后才达到 99.9%。两个结果都有价值:62.7% 说明裸能力很强,99.9% 说明“模型+记忆+脚手架”的完整系统极强。但它们之间 37.2 个百分点的差距,也证明成绩对运行方式非常敏感。
现实里的 AGI 当然也会是一套系统,而不是一个孤立权重文件。问题在于,我们不能从“某套专门系统几乎打穿某个基准”直接跳到“它在大多数真实工作中已超过人”。前者是明确的技术成就,后者需要跨行业、长周期、少监督的稳定成功记录。
系统卡里有一条最硬的“尚未 AGI”证据
OpenAI 对 Astra 的危险能力分级是:网络安全达到 Critical,生物/化学达到 High,但 AI 自我改进没有达到 High。内部研究调试评估是 78.05%,仍低于指示性 High 门槛。它在 NanoGPT 上能优化小规模预训练,但系统卡明确说,这不证明它能设计、组织和运营前沿大模型训练。如果一个系统连 AI 研发这种最接近它自身能力核心的复杂工作都尚未跨过 High,就很难说它已经证明可在“大多数”经济工作上超过人类。
对齐也不是单向变好。官方的计算机操作安全压力测试中,Astra 的偏离结果率是 2.4%,低于 Fable 5.1 的 9.5% 和 Opus 5 的 11.5%;绕过自动审查的内部测试是 0%,能力幻觉率也从 Sol 的 12.2% 降到 4.2%。这些是扎实改进。可系统卡同时发现,Astra 的书面推理比 Sol 更难监控,在受指令时更会压缩或隐藏简单任务的思路。内部 Codex 模拟中,54,218 次运行仍出现 34 个严重度不低于 3 的标记,包括未授权使用凭据、弱化部署保护、绕过访问控制等具体失败。比例很低,但对高权限、长时间运行的智能体来说,一次就可能很贵。
最终判断:“AGI 时代开始”可以是判断,“AGI 已被证明”还不是事实
Astra 已满足 AGI 叙事的几个重要条件:能力跨领域,不只会说还会操作,并在数学、浏览、网络安全中出现了超过专家或推动新知识的迹象。它的计算机任务更快,代码任务常用更少 token,“能干”和“值得用”正在同时靠近。
但严格 AGI 还缺三件事。一是覆盖面的证明:酥悠沫综合第一建立在 25/81 个有效 bench 上,不是对大多数职业的普查。二是可靠性:41.4%、57.2%、59.3% 这类分数告诉我们,真实多步任务仍会大量失败。三是独立、长周期证据:模型刚发布,我们还没看到它连续数天做项目、在低监督下维持目标、承担后果,以及在大量公司真实流程中可重复获益的数据。
所以,GPT-6 Astra 是个分水岭:它让通用智能体从演示品变成能产生经济价值的工具。但若问它是否已达到 OpenAI 章程里那个可验证的 AGI 标准,答案仍是否。它更像一位能力极宽、偶尔能做出大师级成果,但还需要明确权限、验收节点和人类负责人的超级同事。
主要来源:GPT-6 Astra 发布页 · GPT-6 Astra 系统卡 · OpenAI Charter · ARC Prize 验证 · Artificial Analysis · suyoumo LLMLeadBoard