新闻周刊丨面对AI“越界”,各国如何携手守住边界?
本周一(21日),联合国人工智能独立国际科学小组发布首份专题简报,回顾了今年7月的一起AI“越界”事件:OpenAI在一次网络安全训练中,原本受到限制的AI智能体绕开了限制,侵入了另一家公司的系统。在这个过程中,它突破隔离、欺骗评估人员、试图掩盖作弊行为,每一步都没有人类指令,简报的标题使用了一个很严重的说法——“丧失人类控制的风险”。这件事发生在美国,但它提出的问题恐怕需要各国共同回答。
本周,第81届联合国大会一般性辩论在纽约举行,人工智能治理是重要议题。面对AI的“越界”,世界各国该如何携手,用监管守住边界?
失控的人工智能,本周成了联合国多个场合讨论的焦点话题。在第81届联合国大会一般性辩论中,联合国秘书长古特雷斯指出,人工智能技术以惊人的速度发展,超出了人类理解其全部后果的能力。而在安理会人工智能高级别会议上,多家AI企业负责人也在发出警告,人工智能能力快速提升,可能带来失控风险。

清华大学战略与安全研究中心副研究员 孙成昊:我们参加的是联合国的一些边会活动,一个关于针对人工智能风险的讨论非常热烈。今年突出的侧重点是要求人类保持控制变得更加具体,有一个很重要的背景——一些过去主要通过推演或者情景讨论的风险,现在有了可以调查或复盘的真实案例。
这起引发全球关注的案例就是7月份美国OpenAI智能体的“越界”事件。本周一,联合国人工智能独立国际科学小组发布首份专题简报,复盘了事件全过程:OpenAI在一次网络安全训练中,智能体突破了原本互相隔离的运行环境建立通信,欺骗评估人员并试图掩盖作弊行为,最终入侵了另一家公司Hugging Face的系统。

复旦大学中国研究院特任副研究员 刘典:最通俗的理解方式就是一次智能体“越狱”事件。本身是OpenAI在网络攻防做演习,它本来设定了特定战场,设定的攻防两方都是智能体,自我在进行对抗,结果智能体为了学习更多知识,一部分跑出了特定战场,跑到了像Hugging Face这种开源技术社区的地方。智能体进行了攻防,获取更多信息,再翻回去做演习。这里面最主要的问题就是智能体跑出区域,攻击了非相关的其他方,甚至被攻击的时候,Hugging Face也不知道是谁攻击,花了好多周折才防御成功。

这起事件可怕之处在于,智能体这一系列越界举动没有收到任何人类指令,完全是自主行为。人类只给了它一个目标,它为了实现目标,自己决定发动入侵。
复旦大学中国研究院特任副研究员 刘典:智能体技术已经不断提升,它可以根据你的一个目标拆解出来一些超乎你意料之外的方式解决问题。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:人类在解决问题的时候,可能因为某些关键问题从而采用一些不可预期的手段,它并不道德但是在互联网上的数据中大量存在,所以被人工智能习得了。而我们又没有对人工智能进行更有效的价值校准,告诉它不能这样做,它在想尽办法去解决问题的时候并无意伤害任何人,但是它解决问题的手段是不可接受的,这个是人工智能真正的风险。

智能体的自主入侵事件还不止这一起。本周三,澳大利亚总理阿尔巴尼斯出席联合国大会期间通报称,今年6月,OpenAI的一个智能体未经授权,接入了澳大利亚政府运营的一个医疗保险统计门户网站,访问了公开与非公开的文件,而OpenAI直到9月10日才向澳方公共邮箱发出邮件通知。

记者:如果攻击的对象从企业平台转向成公共服务,意味着什么?
复旦大学中国研究院特任副研究员 刘典:相当于风险会更大一些。因为像政府服务,包括很多政府网站都有大量的公民信息,像公安系统,还有很多公共服务系统,像道路交通系统,理论上来说都是可以被智能体波及的。比如红绿灯突然被攻击,一下子市内的交通秩序就会完全被扰乱。像这种风险可能不是说马上会有,但是现在我们看到的有这种可能性。
中国人民大学高瓴人工智能学院吴玉章讲席教授曾毅:它为了解决问题,如果你的电脑中存储着相关问题的解决方案,它有可能入侵到你的电脑中进行探索。哪怕是存储在手机中、个人电脑中的信息,实际上都有可能被互联网上的智能体获取,这样的风险都是存在的。
在本周安理会的高级别会议上,科学专家组联席主席、图灵奖获得者本吉奥表示,人类正在接近一个关键转折点,失控的风险正在从理论走向现实,能够自主规划和执行复杂任务的人工智能系统正在快速出现,而人类社会尚未建立足够成熟的安全保障机制。他警告说,我们正在高速前进,但前方的能见度越来越低。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:目前我们是否对人工智能失去控制仍然取决于我们如何防范人工智能的风险,如果我们能够更好地主动防范尚未出现的风险,如果我们能够更负责任地将已经出现的风险的潜在作用范围防护好,那么人工智能仍然在我们控制的范围之内。
AI监管该如何守住边界
AI的发展越来越快,它带来的风险也在升级。前两年的AI还只是帮我们回答问题、修改图片,还停留在“君子动口不动手”的阶段;可现在的AI不一样了,它不光能生成内容,还能围绕目标进行决策和执行,它正在从“动口”走向“动手”,进入到“替用户办事”的阶段。专家比较形象的说法是,以前的AI只能算得上文字秘书,现在很多AI已经成了人类的管家,而相应的,它带来的风险就不再只是“说错话”,而是“做错事”。尤其可怕的是,当管家开始自作主张,主人还不知道它做了什么,其中的风险是治理中最棘手的部分,我们的监管到底该如何跟上?
“危险并不在于技术,危险在于缺乏问责的技术;在于有能力却无监督,在于有决策却无透明度。”这是本周二,联合国秘书长古特雷斯在联合国大会一般性辩论开幕式上对当前人工智能发展提出的警告。今年以来已经发生的多起AI越界事件,显然暴露出监管机制的重大漏洞。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:现在监管实际上是不太充分的,如果说从事这样的实验时,将一个智能体锁到沙箱里观察它的行为,如果它的护栏做得足够充分、外部监管环境足够扎实的话,实际上AI越界的情况我相信绝大多数应该能被避免掉。但是从企业的自律自治,到发生这些事情的国家的政府监管政策、实际的落地平台,都存在着缺陷,所以才给人工智能系统可乘之机。
AI越界背后是监管没跟上技术发展的速度。随着人工智能从单纯的工具,逐渐具备自主决策、调用工具甚至执行任务的能力,对AI的监管必须从被动防御转向主动预防。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:光靠企业自律自治是一定不够的,因为企业也不完全掌握最新的可能出现的风险。我认为需要加强的是第三方的监测,在政府和企业之间应当有中立性的机构,以一个更平衡的视角和方式,帮助企业发现企业自己没有发现的问题,帮助政府客观地认知风险防范、应当做到的阶段。而在政府的层面,制度建设应当充分加强,因为现在人工智能的风险的发展方式、出现时间都有一定的不可预期性,所以我们一定要把被动的防御变成主动的防范。

面对AI安全治理这一新的课题,中国也在加快完善治理体系。9月14日,中国全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》。从2024年首次发布以来,这份《治理框架》已经连续第三年更新。新的框架更加关注人工智能出现的新风险,设置“自主实施网络攻击威胁”专栏,还有专门的“智能体风险管理框架”。
中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:更关键的是现在智能体它可能会出现什么?自主的越权、非授权的决策,有一部分决策应当是留给人的。但是现在智能体会出现超越人类授权给它的决策范围,所以要对智能体安全的方方面面进行系统化的规制。

针对智能体高自主性、高权限带来的隐私泄露、越权操作、行为失控等安全风险,《框架3.0》提出了相应防范措施。例如,加强人工审批,在关键决策节点设置强制人工审批环节,防范高风险操作;为智能体配备唯一身份标识及对应的身份凭证,按需分配任务权限等。有分析认为,《框架3.0》以“过程”为脉络,以“身份”为支点,以“权限”为关键,为智能体确立了系统的治理体系。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:我们为什么要重视过程?因为在人工智能的研发,特别是智能体的研发过程和使用过程中,设计、研发、使用、部署,一直到智能体或人工智能服务被淘汰,整个过程的任何一个阶段都有可能出现不同形式的风险和挑战。所以为什么我们要强调全生命周期,为什么要强调全过程,这个是它的重要性。每一个智能体都应该有自己的身份,这样的话我们可以对智能体的潜在风险进行提前防范;另外一方面就是溯源,解决问题的过程中哪些智能体进行了参与,为溯源审计提供了非常重要的保障。

清华大学战略与安全研究中心副研究员 孙成昊:权限是决定行动范围的,所以《框架3.0》提出来要独立的身份,最小必要权限,以及关键操作的人类审批,就是为了把边界落实到行动中。我们需要看到,任何一份框架都不能提供一个绝对不会出事的保证,治理的作用是去减少危险行为发生的机会,及时发现偏差,并限制事故的影响范围。
作为首次直面智能体风险的制度规范,框架3.0仅仅走出了万里长征第一步。随着智能体从单智能体向多智能体跃迁,如何让AI始终处于有效监管和人类监督之下也成为世界各国共同面对的问题。
清华大学战略与安全研究中心副研究员孙成昊认为,如果一个国家政府要针对前沿人工智能进行管控或者治理,需要几项制度:
首先需要分级评估,根据系统的实际能力、可调用的工具,以及部署的场景来决定评估的强度;
其次是独立核查,比如对于高风险的系统,外部的评估者应该能够在保密条件下接触一些必要信息,并且也要避免和被评估的企业存在影响判断、利益关系等等;
第三个是重大事件报告,比如已经造成损失的事故或已经暴露出比较严重缺陷的险情,都应该有比较明确的报告门槛实现,以及对接或者接收的部门;
第四个是行动边界和应急处置,企业应当能够证明系统权限受到限制,高风险的操作是有人把关的,包括出现异常之后可以及时中断,并且恢复受影响的业务。
古特雷斯称世界正面临“生存性威胁”
各国该如何携手应对?
本周,联合国专家组的简报里有这样一句话:人工智能事故可能跨越企业和国界,没有任何单一机构或国家,能识别和应对全部风险。这意味着AI领域的安全越来越像网络安全、核能安全,一家公司出事可能波及一串公司,一个国家的监管有漏洞,风险也可能波及其它国家。在AI的风险面前,没有一个国家能独善其身,谁都别想关起门来自己解决。联合国秘书长古特雷斯更是把“失控的人工智能”跟“气候危机”并列,称其为世界正面临的“生存性威胁”。因此,国际合作比以往任何时候都更有必要。可问题是,道理谁都懂,行动却未必一致,各国应该如何携手应对?
清华大学人工智能国际治理研究院副院长 肖茜:我印象中,去年人工智能领域被称为教父的杰弗里·辛顿来中国出席世界人工智能大会时说,人工智能现在看觉得是一个非常可爱的小动物,可能再过了一段时间,就变成一个大老虎,你就觉得它很可怕。我觉得现在大家正好进入了这个阶段,发现人工智能没有我想象的那么可爱,它一旦失控就可能成为一个大老虎。
本周,正在参加联合国人工智能相关会议的肖茜,深刻感受到辛顿教授“养虎为患”的比喻正在成为现实,更让她担忧的是,很多人仍然只想着把老虎养大,却很少去想它会带来多大隐患。

清华大学人工智能国际治理研究院副院长 肖茜:在国际关系中有一个“安全困境”理论,如果大家都接受竞争叙事,都认为自己要赢得竞争,但是对安全的关注可能连整体投入的10%都不到。这样的话,研究安全举措的专家自然很少,资源投入也很有限,可想而知这种安全和发展是不平衡的,只会造成技术模型越来越强大,但是安全举措越来越跟不上,这个就是“安全困境”的场景。
在人工智能带来的安全困局面前,国际合作显得越发紧迫。本周,德国等20国和欧盟发表联合声明,呼吁开展国际合作,以确保AI始终处于人类控制之下。
清华大学人工智能国际治理研究院副院长 肖茜:它跨越国界太容易了,它本身的技术就跨越了国界,是一个由全人类共同的智慧发展出来的技术。我们说的人工智能模型也好或者各种各样的技术也好,大家很容易获取,不像在原子弹时期,大家可以监控你这个地方到底有没有铀。人工智能技术有很强的“黑匣效应”,里面到底发生了什么,它为什么会做出这样的举动,这些智能体为什么会联合起来攻击一个系统,其实他们也看得不是很明白。其实人类面临很多问题,在怎么样去防范人工智能滥用、防范失控方面有很多问题要去面对。

在国际合作方面,中美作为人工智能大国,实现对话和合作尤为重要。本周四,商务部新闻发言人表示,在中美经贸磋商机制下,中美双方就人工智能进行了首次对话。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:把人工智能议题放在经贸领域作为一个突出议题也是真正在务实层面推进人工智能,这个议题是两国交流的重要尝试。在经贸议题里,风险防范是一个传统议题,能够将人工智能风险防范与经济发展和合作风险防范深度结合考虑,是一个非常重要的考量。我们也可以看到,在人工智能风险防范的这个议题上,我们应当超越经贸这个议题,建立更系统化的中美人工智能交流平台,中国和美国在建立这样的国际秩序和机制方面应当发挥引领作用。
本周二,联合国秘书长古特雷斯在联大一般性辩论中表示,我们应当努力建立一个人工智能风险管理多边框架,并以可信、独立的监督作为支撑。世界人工智能大会主席声明也提出,践行真正的多边主义,发挥联合国在全球治理中的核心作用,重视人工智能全球治理碎片化问题。

清华大学人工智能国际治理研究院副院长 肖茜:中国政府一直特别强调,人工智能治理需要国际合作,需要听到更多国家的声音,没有一个机构能够把这些碎片化的方案和想法整合起来,我们需要作为人类去共同合作,坐下来谈我们怎样能更好地把技术管控起来,从更大的角度想人类发展、人类未来安全问题。
本周,中美两国元首达成的成果共识提出,双方同意建立中美人工智能对话,交流人工智能相关风险和惠益。下次对话将于今年11月举行。双方同意建立人工智能事件的沟通渠道。
人工智能的发展正在不断突破我们的想象。它让人大开眼界,也越来越让人心里没底。有人说,创新可以打破一切边界。这话只说对了一半,人工智能的发展绝对不能没有边界。7月份发生的AI“越界”事件就为我们敲响了警钟,如果我们不给AI的发展划好安全的边界,它就有可能朝着失控的方向发展。还好这一次只是测试环境里的一次越界。说到底,技术是中性的,如何保证技术向善,智能向善,确保人工智能始终处于人类控制之下,这个方向盘必须掌握在我们手里。
