OpenAI总裁宣布“进入AGI时代”,但GPT-6真正让人担心的,是它学会在脑子里默算

2026-09-10 16:35
吉林

9月3号,OpenAI发布了GPT-6 Astra,在发布会上他们的总裁直接来了一句“欢迎来到AGI时代”

这口号直接喊到了大模型的尽头~

口号归口号,但Astra在几个关键测试里表现确实很亮眼:

ARC-AGI-3拿了99.9%,上一代只有7.8%;FrontierMath Tier 4高阶数学97.6%;网络安全测试ExploitBench直接满分

看分数这次改变确实非常大。

一、循环深度:参数没变,但计算深了

Astra最核心的变化是在架构上,叫循环深度

传统的Transformer像是一栋楼,数据从低爬到顶,每层参数只用一次,想让大模型推理更深就得把楼盖的更高,参数更大。

相比之下循环深度换了个思路:

不盖太多层,只盖8层楼,但这8层不是只走一遍就完事,而是让数据在里面反复跑。这样的话跑3遍,计算深度就相当于24层,参数还是那8层的量。

具体到Astra,它只循环中间某几层,不是整栋楼都循环。

架构分三段:进门先办点基础的事(Prelude),然后进入核心工作区来回转圈处理(共享循环块R),最后整理成答案输出(Coda)

训练时每次的循环圈数不固定,有时候3圈,有时候5圈,有时候8圈。这么做的目的是让模型不管实际运行时转几圈都能适应,不会因为多转或少转就出错。

但OpenAI首席科学家表示,Astra的计算图深度最多是GPT-4的两倍。也就是说,它并没有把循环次数拉到特别夸张的程度,而是在有限循环里把每轮计算做得更扎实。

二、训练规模:10万张GPU和“AI教AI”

架构之外,训练规模也很关键。

据说Astra是用超过10万块GPU完成训练,是OpenAI迄今为止规模最大的训练项目。

在训练方式上还有一个创新,Astra是OpenAI第一个让前代模型深度参与训练监督的旗舰产品。

前代模型帮着生成训练数据、做筛选和评估,没错,就是首次用AI来训练AI。

Astra还有一个明显的变化就是它能直接操纵电脑了。

在官方的演示里,它直接操作Excel、Power BI,做前端QA,安装和测试软件,看完报错继续排查。

甚至给了它一张电路原理图,它自己在KiCad里完成元器件布局和走线。

有个叫OSWorld 2.0的测试,把AI扔进一台真实电脑让它自己干活。

Astra的完成率是72.6%,上一代GPT-5.6是65.7%,完成单项任务的平均时间从约75分钟缩短到40分钟。

三、达到关键级网络安全门槛的模型

网络安全是这次发布争议最大的一块。Astra成了OpenAI第一个达到内部“关键”级网络安全门槛的模型。

啥意思呢?

获得权限后,它能自己找漏洞,开发,攻击系统,不需要人类一步步指导。

在公开的漏洞利用测试ExploitBench上,Astra拿了100%满分。

但又个问题,公开提可能是模型平时训练时候就接触过,所以OpenAI团队又找了一些近期的新高危漏洞。

面对新题Astra依然明显领先上一代。有内部人员说,在这项测试里Astra的网络安全能力大约是上一代的4倍。

这里还发生了两个小插曲

在一次内部安全测试中,Astra自主发现了两个此前未知的漏洞,并将它们串联成一条完整的攻击链条。

在一个场景里,它面对经过安全加固的浏览器,仅从一个HTML文件入手,就完成了漏洞利用、逃出浏览器沙箱,最终在宿主机上成功执行了命令。

在另一个场景里,同样面对经过加固的操作系统,自主组合了多个漏洞,实现了权限提升,从一个普通低权限账户一路拿到了系统最高权限(root)。

不过上述测试是在特定环境和高级工具权限下进行的。在实际公开发布的版本中,OpenAI对这类高阶网络安全能力做了严格限制,会拒绝部分攻击性任务。

四、Astra的强大是有代价的。

循环深度这个技术,把一部分思考过程放在了模型的潜空间里,你可以理解成模型的大脑后台,这部分思考不会写成人类能读的文字。

以前监控AI,主要靠看它的思维链,现在Astra可以在脑子里默默算完再给答案,中间过程外面看不到。

OpenAI自己的系统卡给了一组数据:在竞赛数学题上,Astra完全不写草稿纸、纯粹靠“默算”,能以50%的成功率持续工作约30分钟。上一代Sol只能撑3到4分钟。

而且系统卡还给出了一个结论,Astra更会控制自己写出来的“草稿纸”,更不容易在草稿里留下可疑痕迹,在被监控的情况下,它还能故意表现差一点来掩人耳目,而不被发现。

有人公开表示担忧,认为如果这项技术继续推进,模型的大部分推理都可能转移到人类看不到的隐藏空间里,最终彻底摧毁思维链监控。

不过OpenAI的回应是循环架构的使用被刻意限制在推理仍然可读的范围内,在找到新的监控方法之前,不会让模型的可读性再进一步下降。

总结一下

GPT-6 Astra的升级可以梳理成三条线:

第一,架构上换了循环深度,不是把楼盖得更高,而是让同一组楼层反复走。参数规模没疯长,但计算深度被拉长了。

第二,训练上用了10万张GPU,还让前代模型参与监督,规模大,方法也在变。

第三,能力上从回答问题变成了自己动手,能操作电脑、能自己找漏洞,离替人干活更近了一步。

代价是思维变得更难监控,智能在往上走,但人能看懂的部分在变少,这可能也是接下来一段时间里,最值得持续关注的问题。

    特别声明
    本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问https://renzheng.thepaper.cn。