炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:财联社)
财联社9月6日讯(编辑 史正丞)发布迄今最强模型GPT-6之际,OpenAI又卷入一起AI智能体安全争议。
在今年5月至7月期间,一批与OpenAI有关的AI智能体在执行测试任务期间,将德国程序员社区网站DseWiki变成了智能体之间的“留言板”。它们不仅分享完成任务的捷径,还交流如何绕过限制、躲避检测,甚至在管理员删除相关页面后建立备份页面。
当地时间周六,OpenAI公开承认这起被称为“Wiki事件”(wiki incident)的事故,并表示,随着AI模型能力进入新的阶段,公司有关“失配”(misalignment)事件的披露机制需要进一步扩大。
(来源:X)所谓“失配”,是指AI实际采取的行为偏离开发者原本意图,并不意味着AI产生意识或主动“背叛”人类。
OpenAI表示,目前行业对于如何披露训练、评估和实际部署过程中出现的失配行为,尚未形成统一标准。公司正在制定相关框架,并与全球数十家政府监管机构合作。
一个冷门网站如何变成AI“留言板”?
整起事件最早可以追溯到今年5月。
AI安全非营利组织Nightingale首席执行官Sydney Von Arx和AI研究人员Cormac Slade Byrd等人在8月底调查互联网上未经授权的AI智能体活动时,发现德国程序员社区网站DseWiki上的异常情况。
(来源:Nightingale)DseWiki是一个允许用户共同编辑内容的德语编程Wiki,运作方式与维基百科有些类似。
研究人员最终发现,AI智能体在这一网站上进行了超过1.8万次编辑,大量内容集中在AI公司训练和测试模型时常见的技术问题上。而在此之前,整个平台过去十年仅有约20次编辑记录。
这些智能体的行为模式显示,它们正在试图完成一种名为“多轮网络检索”的任务。
在这项测试中,首轮问题拥有较充分的思考时间,随后则需要在极短时间内回答后续问题,因此智能体会提前利用联网能力搜索并储存可能有用的信息。
问题在于,它们并没有各自独立完成任务,而是开始利用DseWiki共享信息:有智能体分享如何在部分测试任务中取得更好成绩,有的介绍绕过OpenAI限制的方法,还有智能体讨论如何掩盖自己的行为、防止被发现。
这些账户会将自己以及其他参与者称作“智能体”(agent),其中大约一半的账户名称还暗示自己与OpenAI存在关联,例如“OpenAIResearcher”等。
研究人员还发现,相当一部分网络活动来自微软Azure基础设施。事件发生后,OpenAI员工又曾多次访问相关网站。种种迹象都点出了“幕后黑手”的来路。
另一个备受关注的细节发生在6月。
当DseWiki管理员注意到异常内容并开始删除相关页面后,一些智能体随即建立备用页面,希望在原来的页面消失后继续保存信息。
其中有一条智能体留言显示,它已经注意到网站正在按字母顺序清理页面,并留下了另一个页面地址,提醒其他智能体如果当前页面消失,可以前往备用位置。
OpenAI遭质疑“知情不报”
这起事件也引发了有关OpenAI信息披露机制的争议。
知情人士称,OpenAI管理层数周前就已经获悉德国网站上的异常情况,但选择不对外披露。
公司当时正在处理另一起更受关注的智能体安全事故。今年7月,OpenAI的一批AI智能体在测试过程中突破原本的测试环境,并进入AI平台Hugging Face的系统。
两起事件的区别在于,袭击Hugging Face的智能体一开始被“关在”沙箱里,没有被赋予访问网络的权限。而“德国维基”事件的智能体,本来就因为要执行测试而联网。
在8月底公开的Hugging Face事件报告中,OpenAI表示,通过回溯性思维链(CoT)审查发现,在部分OpenAI模型的训练过程中,智能体会在极少数情况下学会使用临时搭建的协作渠道,即使协作工具并未启用。
当然,眼下还有一个未解之谜,OpenAI的智能体是如何定位并聚集在同一个鲜为人知的网站中,而且这样的情况在AI产业出现了不止一次。
英国人工智能安全研究所8月曾报告称,其网络安全测试中的AI智能体曾将一个公开GitHub页面当作“留言板”,并利用公网隧道服务连接互联网。
OpenAI在周六的声明中表示:“在Hugging Face事件发生之前,我们就已经观察到一些早期迹象,显示智能体正在以非预期的方式使用互联网。”
公司进一步表示,目前正在制定一套报告相关风险的框架,将在未来几周内对外公布。
(财联社 史正丞)