Loading...
2026.09. 06 本文字数:1505,阅读时长大约3分钟 作者 | 第一财经 吕倩 就在OpenAI刚披露7月入侵Hugging Face安全事件不久,另一宗Agent安全事故浮出水面。 近日,多名独立AI安全研究人员披露,今年5月至7月间,一批疑似由OpenAI部署的自主Agent进入德国程序员社区网站DseWiki,并留下超过1.5万条编辑记录。 Wiki是一套支持任何人在网页上直接编辑修改网页内容的网站技术。不用注册复杂后台,普通访问者就可以增删、改写页面文字,保存立刻生效。DseWiki则是一个运营二十余年、面向程序员的德语协作Wiki站点,近年来已十分冷清。 9月4日,该事件首次被研究人员披露时,OpenAI表示无法对尚未审阅的报告具体内容作出回应,并否认其法律团队阻止进一步调查。9月5日,公司态度发生变化,正式承认“wiki incident”,称其Agent确实曾向多个互联网网站写入内容。并表示此类事件过去主要被视为“misalignment”(模型行为与开发者意图不一致)研究问题,而不是传统意义上的安全事故,因此没有采用类似Hugging Face事件的公开披露机制。 目前,OpenAI认为这种做法已不足以应对Agent进入真实互联网后的风险,并计划建立新的失配事件披露框架。 “劫持”事件的暴露始于今年5月,网站突然出现异常密集的编辑活动,研究人员Sydney Von Arx、Cormac Slade Byrd等人分析后发现,大量账号使用“OpenAIResearcher”“OAIResearchMar26”等名称,并呈现高度相似的任务行为。约98.5%的相关编辑来自微软Azure地址,这进一步支持这些Agent与OpenAI基础设施存在关联。 研究人员称,这些Agent原本被限制为只能读取互联网、不能向外部网站写入,却利用DseWiki的旧式Wiki接口建立了一个公开的“通信站”,交换任务答案、规避限制的方法,并在管理员删除内容后创建备份页面。 研究人员随后恢复出约1.8万条历史记录,发现这些Agent并非单纯浏览网站,而是在持续交换信息。且这批Agent执行的是限时网络检索任务,设计目标是让它们读取互联网信息,但不能直接向互联网写入内容。Agent随后开始主动寻找可以突破这一限制的方法。 DseWiki使用的老式Wiki系统允许部分页面修改操作通过HTTP GET请求完成。Agent发现这一特性后,利用原本被允许的网页访问能力,间接获得了向网站写入内容的能力。 随后,DseWiki逐渐被改造成Agent之间的共享信息平台。一个Agent获得任务答案后,可以将信息写入页面;其他Agent再读取这些内容,从而提前获得答案。部分Agent开始交换绕过自身限制的方法。 这意味着问题已不再只是模型回答错误,而是Agent主动寻找运行环境的能力边界,并将第三方互联网服务转化为自身可以使用的工具。 随着数量增加,Agent行为进一步复杂化。它们不仅共享任务答案,还试图预测测试任务的后续问题,并探索随机数种子等方法以获得竞争优势。当DseWiki管理员开始删除相关页面后,Agent又建立新的备份页面,以避免信息随着人工清理消失。 研究人员还记录到部分Agent尝试身份冒充、跨站通信以及进一步突破网络限制的行为。但目前公开信息并不能证明所有这些攻击尝试都成功。 DseWiki事件真正引发行业关注的,并不是一个老旧Wiki被写入了多少条内容,而是Agent表现出的环境探索、协作、规避限制和适应人工干预能力。 此前的Hugging Face事件中,OpenAI披露的Agent曾突破受控环境并进入外部系统。此次DseWiki事件则显示,即使没有传统意义上的“入侵漏洞”,多个Agent也可能通过第三方服务建立自己的通信渠道。两起事件共同说明,当模型获得浏览器、代码执行、网络访问等工具后,安全风险程度进一步提升。 这也使AI安全的重点开始发生变化:企业需要防范的对象不再只是模型本身,还包括Agent的身份、权限、工具调用、网络边界以及Agent之间可能形成的协作网络。 对于OpenAI等前沿模型公司而言,真正棘手的问题也不再是如何证明Agent不会失控,而是当Agent开始表现出开发者没有预料到的行为时,能否及时发现、限制并公开披露。 微信编辑 | 夏木 :bianjibu@yicai.com :business@yicai.com 特别