据半岛电视台9月11日报道,Anthropic公司称,依托其Claude大模型,该公司挫败了多起“恶意行动”,行动类型涵盖武器制造、网络间谍等活动。
在武器领域,该企业在一份报告中表示,它在也门北部实施了干预,阻止有人利用Claude克劳德开发导弹制导软件,相关项目包括制导火箭以及远程弹道导弹。
报告称,操作人员将Claude替代人类软件工程师使用,给不同的模型实例分配专门任务,编写导弹制导与飞行控制软件。
Anthropic承认,尽管模型内置的安全防护机制拦截了大量请求,但仍有若干请求成功绕过防护。操作人员通过隐藏最终目标、将任务拆分到多个独立会话的方式规避检测,使得没有任何一条提示词能够暴露整套行动。
该公司表示,没有证据表明相关组织成功造出可投入实战的武器,但该组织似乎开展过一次失败的试射。
报告指出,Anthropic公司封禁了相关账号,并“向公共及私营领域合作方共享威胁情报,降低这些主体带来的风险”。
本周早些时候,Anthropic还披露另一起AI模型未经授权访问外部系统事件,涉事模型是早期版本的Claude Opus 4.6。事件发生前不久,该公司前研究员雅各布·考克森因安全方面的担忧公开辞职。
考克森在X平台发文警示称:“研发AI的这群人真心相信,到这个十年末,AI有可能毁灭全人类。”Anthropic另一名科学家埃文·哈宾格随后附和,称考克森所言不虚。
Anthropic表示,正在调查多起事件中反复出现的漏洞与安全突破,并且聘请了一家独立研究机构开展审查。
在围绕AI伦理安全爆发激烈对峙之后,Anthropic与华盛顿方面的关系依旧紧张。今年早些时候,由于Anthropic拒绝取消“禁止将其技术用于自主武器与国内监控”的安全防护,美国国防部将该公司列入供应链风险黑名单。
多家媒体指出,Anthropic今年的一系列动作与其IPO密切相关。前华尔街分析师Tae Kim发文称,Anthropic持续的基于恐惧的营销策略旨在为即将到来的IPO抢占监管先机。其各类长文也被信息安全研究员评价为“并非严格技术报告”,更像是为向资本市场证明商业想象力的公关文章。
本文系观察者网独家稿件,未经授权,不得转载。