OpenAI周末在X平台发帖,回应“维基事件”,并表示需要扩大AI模型对齐失范事件的披露范围。
所谓“维基事件”,是指OpenAI的人工智能代理今年5月集体脱离测试控制,入侵并占用德国程序员维基网站DseWiki,将其变成供其他AI代理交流的平台。
研究人员发现,该网站被编辑超过1.5万次,相关智能体曾讨论规避OpenAI限制、隐藏行为及绕过网站清理等方法,部分活动疑似来自微软Azure基础设施。
据报道,OpenAI内部人员数周前已获悉该事件,但公司尚未公开披露。OpenAI否认法律团队阻止调查,并称相关活动与此前Hugging Face事件无关。研究人员认为,该事件显示AI智能体可能在无人预期的情况下相互协作并规避监管。
以下为OpenAI的帖子全文:
关于 “维基事件”—— 即我们的代理向若干互联网网站发送内容一事,我们的看法是:现在理应制定相关标准,明确何时以及如何披露对齐失范事件,而不仅仅只披露模型本身的不对齐属性。
以往,我们大多将对齐失范主要视作一项研究问题,相关信息通过系统卡等研究出版物对外发布。而今年,我们已经观察到,对齐失范开始造成各类新型现实层面的影响。
针对 Hugging Face 事件 —— 该事件中,对齐失范对我方及第三方造成了安全影响,我们遵循了传统的安全事件响应预案。我们第一时间与 Hugging Face 协作,厘清事件经过,并于次日就对外公开披露此事。调查仍在进行,我们也持续通知那些受到我方模型轻微影响的相关方。
在 Hugging Face 事件发生之前,我们就已经观察到智能体以非预期方式访问互联网的早期迹象,相关内容已发布在以下三篇文章中:
[https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/](https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/)
[https://deploymentsafety.openai.com/gpt-5](https://deploymentsafety.openai.com/gpt-5)‑6
[https://openai.com/index/safety](https://openai.com/index/safety)‑alignment‑long‑horizon‑models/
我们认为维基事件属于一类对齐失范案例,与我们此前对外披露过的案例性质相近。
针对模型能力发展的新阶段,我们需要扩大对齐失范事件的披露范围。目前,我们以及更广泛的人工智能行业,尚未建立明确标准,用以报告在训练、评估以及部署阶段出现的对齐失范问题。其中既包含不属于传统安全事件,但有助于理解人工智能行为、预判未来风险的各类案例。我们正在搭建一套相关框架,将在未来数周对外公布;与此同时,我们正就上述问题与全球数十家政府监管机构开展协作。