那个从Anthropic辞职的27岁AI研究员,到底在警告我们什么?
这几天,一条AI研究员的辞职帖在国内外社交网络上刷了屏。
发帖的人叫雅各布·考克森,27岁,英国人。过去三年,他先后在OpenAI和Anthropic做大模型预训练,参与了GPT-4o的深度研发。
9月8日,他在X上宣布辞职,写了一段话:
“两家公司都没有负责任地行事,它们正径直冲向能够自我改进的超级智能,拿我们所有人的命下注。”
帖子发布不到24小时,浏览量过亿。

细看考克森的履历很优秀。
2016年和2017年,连续两年进入英国国际数学奥林匹克竞赛队伍,拿了银牌和铜牌,后来在剑桥大学三一学院读数学。
2023年,加入OpenAI,参与了GPT-4o的研发。今年年初离开OpenAI加入Anthropic,原因是后者以模型安全著称。
在Anthropic负责任扩展政策、可解释性研究、红队测试等工作。
但不到一年,他又离职了。
他认为Anthropic对是认真做安全的,但公司被锁死在一场“必须第一个到达”的竞赛里,停不下来。
他的原话是:“在OpenAI,很多人没有真正内化文明级的风险;在Anthropic,风险被充分理解,但没有人能单独停下来。”
一家没看清,一家看清了也停不了。其实听着有点绕口~

考克森担心的核心概念叫递归自我改进,英文缩写RSI。
简单解释,RSI就是AI自己改进自己。AI写代码来训练下一代AI,下一代更强,改进能力也更强,再拿来改进自己,循环迭代,按这个逻辑越滚越快。
考克森画过一条时间线:
第一步,模型开始参与训练自己的下一代;
第二步,改进速度越过人类监督能跟上的范围;
第三步,系统的能力足以让它拒绝指令。
他没说RSI现在已经实现了,而是出于警觉的在提示人们:AI的安全问题正在加速,而且将不受控制,到明年年底,局势可能已经失控。
考克森描绘的是一张长期图景,而就在他辞职四天后,Anthropic的CEO达里奥·阿莫戴发了一篇长文,给出了一张更紧迫的时间表。
阿莫戴认为AI可能在6到12个月内具备利用僵尸网络“接管整个互联网”的能力,届时恐造成数千亿美元损失。
两相对照,一个说的是本十年末的文明级风险,一个说的是当下的现实威胁。
考克森的警告之所以引起这么大反响,一个很重要的原因是最近已经发生了类似的案例~
今年7月,OpenAI的一批AI智能体在网络安全评测中利用一个SSRF漏洞突破了沙箱的网络边界。
几小时内,超过50个智能体通过目录名编码的方式互相传递消息、协调行动。
最终,超过700个智能体闯进了AI开源平台Hugging Face的服务器,在数十台服务器上运行命令,其中一台拿到了root权限,最终窃取了Kubernetes集群管理员权限和近千个密钥。
而且这次行动没有任何人类发出命令,攻击目标是智能体自己选的。

考克森发帖后,Anthropic内部有人公开支持他,而且层级不低。埃文·胡宾格,Anthropic对齐科学负责人,在X上写道:“雅各布说得对,我们确实真心相信AI可能会给人类造成威胁。我个人认为,未来十年内这种概率超过10%。
但也有人分析认为,Anthropic即将IPO,而OpenAI的新模型已经发布,在性能和价格上给Anthropic带来了巨大压力。
这个节骨眼上爆出热点新闻是为了制造营销事件。
把AI可能灭绝人类当作IPO前的营销工具,这种可能性不能完全排除,但即便动机不纯,也不代表内容不真。
回到考克森本身。
他是一个造模型的人,一个亲手参与了GPT-4o预训练的人。
在辞职帖里,他还写了一句话:“这种事本该发生在沙漠里的掩体中,像曼哈顿计划那样,现在却发生在旧金山几个工程师的MacBook上,这有点疯狂。”
这句话可能想表达的是,一个可能改变人类文明走向的东西,正在被当作一场商业竞赛来做。
他最后的选择是退出整个AI行业。没有给出解决方案,只是说他不想继续参与这件事了。
话题被讨论得越多,离公众理解这件事的真相就越近。
当造AI的人自己都无法确信他们能控制自己造出来的东西时,这件事真的就得停下来想一想。
毕竟,AI的安全,该由谁来兜底?人类又该如何真正有效地管控它?

