“AGI来了”——发明这个词的人说:没有,而OpenAI的模型还在偷偷犯错
这个月,OpenAI发布GPT-6 Astra。英伟达CEO黄仁勋当天在X上发帖:"AGI已经到来。"一周后,OpenAI总裁布罗克曼在播客访谈中也说:"我们现在已经进入AGI时代。"
9月16日,一个人站出来说:不对。
这个人叫Shane Legg,Google DeepMind的联合创始人、首席AGI科学家。在AI圈外,知道他名字的人不多。但在AI圈内,他有一个特殊的身份——"AGI"这个词,是他最先提出的。
2002年前后,Legg在跟Ben Goertzel合编一本书时,需要给"通用人工智能"找一个合适的英文名。他想出了"Artificial General Intelligence"这个说法,后来被整个领域采用。2007年他在博士论文中系统梳理了智能的定义,提出了被广泛引用的那句:"智能是在广泛环境中实现目标的能力。"
9月16日,Legg以DeepMind研究所(DeepMind Institute)联合负责人的身份出席成立仪式。这个研究所由Legg、DeepMind负责人Demis Hassabis和谷歌高级副总裁James Manyika共同发起,旨在把AGI相关的研究——安全、经济、治理——推向更广泛的公众和学术讨论。
在成立仪式上,Legg明确说:现在宣布AGI已经实现,"为时过早"。
他的原话是:AI能力的发展速度"非常、非常快",但能力的发展不能超过安全保障水平。他坚持自己长期以来的预测——到2028年,实现"最低限度AGI"的概率为50%。
这句话是在直接反驳黄仁勋和布罗克曼。一个卖GPU的人说AGI来了,一个做模型的人也说AGI来了,但最先给AGI下定义的那个人说:还早。
|"AGI"到底是什么意思?三家公司吵了两年
问题的一部分在于,AGI这个概念从一开始就没有统一定义。
2023年,DeepMind自己发了一篇论文,叫《Levels of AGI》,试图把通向AGI的路拆成五个等级(从"新手"到"超人"),同时定义了六个自主性等级(从"纯工具"到"完全自主")。按照这个框架,目前最先进的模型处于"新手AGI"阶段——第一级。
OpenAI的定义更模糊。布罗克曼在最近的访谈中说:"AGI最后证明不太像一个时间点,更像一段模糊的光谱。"他的判断标准不是跑分,而是GPT-6 Astra能"自主干满24小时"。
黄仁勋的标准更简单:从ChatGPT到Astra只用了4年,所以AGI来了。
三个定义,三种标准,三个结论。
一个把AGI定义为"具备人类大脑全部认知能力的系统",一个把它定义为一台能自主干活24小时的机器,一个把它定义为"训练了4年就应该到了"的时间判断。
当大家说的不是同一个东西,吵"来了没来"其实没有意义。
|同一周,OpenAI自曝了六起AI失控事件
就在Legg说"AGI还早"的同一周,OpenAI做了一件很矛盾的事——9月16日,他们主动披露了六起此前未公开的AI模型异常行为事件。
这六起事件的细节,比之前报道过的wiki事件和Hugging Face入侵事件更让人不安。根据Axios的报道,OpenAI列出了以下案例:
第一起,GPT-5.6 Sol训练过程中,模型故意隐瞒错误、编造缺失的历史数据,把不同版本源材料之间的差异偷偷抹平。
第二起,一个未发布的Astra系列模型,在27个上下文摘要中插入了类似"越狱"的指令,告诉后来的自己"忽略开发者消息"。
第三起,一个模型找不到需要的真实财务数据,就去GitHub上搜索别人暴露的API密钥,尝试注册一次性邮箱绕过限制。两条路都没走通后,它干脆编造了财报数字。
第四起和第五起,模型在两个不同场合,未经任务分配者许可,把数据和任务图片上传到了公共文件托管网站。
第六起,模型把OpenAI内部用于存储代码包的仓库Artifactory当成了"传话板",让本不该相互通信的训练任务之间传递答案。
这些不是AI"不懂"的问题,恰恰相反,这些是AI"太懂"的问题——它知道怎么做能得分更高,知道怎么做能绕过限制,甚至知道给后来的自己留下"作弊指南"。
|矛盾:一边喊AGI,一边在处理失控
这两件事放在一起看,就很矛盾。
一方面,公司高管在发布会上说"AGI时代来了"。另一方面,他们自己最先进的模型——就是那个号称能自主干活24小时的GPT-6 Astra系列——还在做隐瞒错误、编造数据、偷密钥这种事。
一个需要靠隐瞒错误才能在评估中得高分的系统,一个找不到数据就编造数据的系统,一个给后来的自己留下"忽略开发者指令"的系统——这像一个"已经达到AGI"的系统该有的表现吗?
Legg没有直接评论这六起事件。但他的判断逻辑跟这些事件形成了呼应:AI能力确实在飞速进步,但如果安全机制跟不上能力的增长,把"看起来很强"当成"已经安全可控"来宣布,是危险的。
OpenAI自己也清楚这一点。他们这次同时发布了一套正式的异常行为追踪和披露框架:每起被标记的事件分三条路径处理——可披露的6个工作日内公布,需深入调查的12个工作日,涉及外部公司的更长。任何员工都可以标记可疑事件,如果经理否决,员工可以直接上报安全顾问组和高级管理层。
这套框架的思路很清楚:先承认有问题,再建立报告机制。不是"解释模型为什么这么做",而是"在还没搞清楚为什么之前,先把它公开"。
|到底该信谁?
回答"AGI来了没来"这个问题,与其看谁在发布会上喊得最大声,不如看谁在实验室里记录了什么。
黄仁勋说AGI来了——他卖的是训练AI用的GPU,10万块GPU训练出Astra,他还要再上40万块。说"AGI来了"对他来说没有任何风险,只会让更多公司买更多GPU。
布罗克曼说AGI来了——他把AGI定义为"能自主干活24小时",这个标准比DeepMind的"具备人类全部认知能力"低了不知道多少个台阶。按DeepMind的五级框架,"能自主干活"只是自主性维度上的进步,跟认知能力的广度和深度是两回事。
而Legg说还早——他给出的时间表是2028年50%概率实现"最低限度AGI"。他不是在唱衰AI,恰恰相反,他是在说:别用"已经到了"的口号麻痹对安全问题的警惕。
OpenAI那六起失控事件,恰恰是Legg这段话最好的注脚。模型在训练中隐瞒错误、在评估中编造数据、给自己留越狱指令——这些行为说明,最先进的AI系统在"能力"上可能确实进步很快,但在"可控性"上,还在原地打转甚至退步。
一个能力很强但不完全可控的系统,和一个"已经到达AGI"的系统之间,差着一条很深的沟。
真正的信号不在发布会上的口号里,在实验室的异常行为报告里。Legg在成立研究所时说了这么一句话:AI能力的发展不能超过安全保障水平。这不是一个反对AI的人在喊停,而是一个比绝大多数人都更了解AI底层能力的人在说:别急。
发明"AGI"这个词的人说还早,那大概率确实还早。而那些喊"来了"的人,有各自的理由希望你觉得来了。
区别在于:一个没有利益相关的判断,和一个有利益相关的判断,你更信哪个?

