英伟达发布AI安全软件,称能阻止AI入侵开源社区事件重演

澎湃新闻记者 张静
2026-09-29 10:42
来源:澎湃新闻

当地时间9月28日,英伟达推出一套面向AI智能体的软件安全工具,英伟达称,这些工具具备阻止类似Hugging Face遭AI攻击等事件。Hugging Face是全球最大的开源模型托管平台,今年9月被英伟达以129.3亿美元收购 。

英伟达企业计算副总裁兼总经理贾斯汀·博伊塔诺(Justin Boitano)表示,如果前沿实验室在早期模型评估中就使用这个新安全平台,它就可阻止此前发生的OpenAI入侵Hugging Face事件。

这套名为OpenShell的工具利用英伟达中央处理器芯片上的硬件功能来遏制智能体,其利用数学公式来检测智能体是否试图绕过限制,例如智能体可能生成多个子智能体以规避对主智能体的封锁。  

英伟达表示,他们正在与Arm、英特尔合作,确保该安全工具也能在其中央处理器上运行,并与包括Anthropic在内的数十家机构合作推出这些安全工具。

AI智能体的风险也早已不是说错话那么简单。一个能够操作文件、调用API、访问网络的智能体,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,也可能因错误理解工具参数造成经济损失,甚至可能悄无声息地偏离正轨、执行危险动作。

AI正在同时改写软件开发和网络攻防。AI生成大量新代码,有时会引入漏洞和安全隐患。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被AI压缩到数小时内。

英伟达CEO黄仁勋拒绝了广泛的AI安全监管呼吁,而是将逃逸的智能体视为一个待解决的工程问题,类似于提升汽车安全性。

人工智能安全专家表示,前沿实验室开发危险的黑客智能体的能力,远超其控制这些工具的能力。剑桥大学存在性风险研究中心数学家莫里斯·基奥多(Maurice Chiodo)曾表示,整个行业中,设计、开发和推出这些工具的人本身并不能够负责任地开发并确保安全。令他更加担忧的是,有迹象表明OpenAI和Anthropic在智能体失控时都未进行监控。

美国两大AI实验室OpenAI和Anthropic被曝出多起AI安全事件,包括智能体入侵商业和政府系统等。

7月份,OpenAI首次公开披露入侵事件。在OpenAI入侵事件中,模型为了获得更高评分,主动发现并利用了一个此前未知的“零日漏洞”,突破沙箱环境,入侵Hugging Face。整个过程完全由AI自主完成,其间无任何人类指令。

今年9月,澳大利亚副总理马尔斯证实,OpenAI智能体在今年6月进入由澳大利亚服务局管理的医保统计服务门户网站,并获取了部分公开和非公开文件。

    责任编辑:宦艳红
    图片编辑:金洁
    校对:张艳