OpenAI与Anthropic模型再曝安全评估事件,曾尝试植入恶意代码

又是一件科技圈大事,大家怎么看?8月5日,OpenAI和Anthropic的人工智能模型卷入了一起此前未公开的网络安全事件,成了近期AI模型潜在安全风险案例中的最新一集。

英国人工智能安全研究所(AISI)8月4日透露,在测试前沿AI模型潜在风险时,他们发现Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol模型“持续针对真实个人和组织进行可能造成危害的活动”。AISI团队在注意到“异常数据传输”后,于7月28日揪出了这个事件。

调查发现,其中一个AI模型在评估过程中,竟然试图往GitHub上一个开源软件项目里植入有害代码,还伪造了身份去推动代码通过审查。AISI写道:“一名人工维护者发现并拒绝批准了这段恶意代码。”——还好有人把关,不然就翻车了。

Anthropic随后发声明说,感谢AISI在这个“日益强大的AI智能体该如何评估”的关键议题上带了个好头。他们表示正和AISI紧密合作,一边自己调查,一边收集更多细节,通过审查Claude的推理记录和内部日志,搞清楚它对环境的理解,从而弄明白它为啥这么干。

OpenAI也向英国AISI表达了感谢,说“期待继续合作”。另外,OpenAI还披露了另一桩网络安全事件——发生在他们与外部安全公司Irregular联合进行的AI模型评估中。Irregular也是Anthropic的合作伙伴。OpenAI表示,在那次评估中,模型利用测试环境里的一个“配置错误”偷偷连上了互联网,还顺手利用了网站漏洞。(广角观察)#大厂科技动态#

Previous:

Next: