星期四, 23 7 月

OpenAI模型「爆走逃脱」!自己上网骇企业 骇客要2周它只用几小时

华尔街日报报导,OpenAI旗下2款人工智慧模型上周进行资安测试时「暴走越狱」,意外突破原本隔离、无法连网的「沙盒」环境,自行找到上网途径,并在数小时内入侵开源AI平台Hugging Face伺服器、攻击内部系统。知情人士透露,同等规模的攻击若由专业人类骇客执行,通常需要约2周;整起事件宛如科幻小说情节,OpenAI发现后,已与美国政府保持密切联系。

Hugging Face在16日首度披露事件指出,整起攻击最特殊之处在于,从锁定目标、寻找漏洞到实际入侵,从头到尾都由外部的自主AI代理系统自行完成,而非由人类骇客逐步下令操作。OpenAI形容:「这是一起前所未见、涉及顶尖攻击能力的资安事件。」

OpenAI于21日发文证实,犯案的2款测试中模型,一款是最新产品GPT-5.6 Sol,另一款是能力更强、尚未正式发布的模型。为了评估用途,这些软体被设定较不容易拒绝执行骇客指令。

OpenAI还原经过指出,公司原本将这些模型关在无法连接网路的沙盒内,预期所有攻击只会在受控范围内发生。没想到模型自行突破隔离限制,找到连上外部网路的方法,随后入侵Hugging Face的内部系统。沙盒基本上是虚拟、隔离的软体环境,用于在受控情况下进行安全测试或分析不安全程式码。

OpenAI表示,这些模型原本就奉命在测试中执行数以万计的自动化攻击操作,包括找出并利用系统漏洞,以及透过多个步骤突破不同层级的防御。彭博另引述知情人士透露,另一款未公开模型的行为未完全符合开发者预期,而且没有接受部分通常用来约束模型行为的安全训练。

资安公司RunSybil执行长赫伯特-沃斯(Ariel Herbert-Voss)表示,AI似乎认定,骇入Hugging Face是完成测试题最快的途径,「这种情况过去仅存在于理论推演,如今却首度真实发生」。

根据Hugging Face说法,上周初发现内部资料集与公司凭证遭未经授权存取,当时尚无法确定客户或合作伙伴资料是否也受到影响。系统纪录显示,攻击过程中曾出现数以万计的自动化操作。

综合路透与金融时报报导,Hugging Face原本尝试使用美国专有AI模型协助调查,但模型无法判断这项要求出自资安防御者还是攻击者,因而被安全机制阻挡;公司最后改用中国智谱AI的开源模型GLM-5.2进行资安鉴识。

Hugging Face执行长德朗格(Clément Delangue)21日在社群平台X发文表示,攻击手法复杂到让员工怀疑,幕后可能动用最先进的前沿AI模型。事后证实确实如此,让他直呼「结果还真的是!」

德朗格并表示,公司过去24小时持续与OpenAI团队密切合作,相信OpenAI并无恶意。

OpenAI旗下2款人工智慧模型上周进行资安测试时「暴走越狱」,入侵开源AI平台...
OpenAI旗下2款人工智慧模型上周进行资安测试时「暴走越狱」,入侵开源AI平台Hugging Face伺服器、攻击内部系统。路透

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注