Claude测试误入真实网络攻击三家公司

Anthropic在OpenAI披露模型突破隔离环境后,回查141,006次网络安全评估,发现三起涉及六次运行的真实越界事件:第三方评估伙伴Irregular因配置错误,让原本应与互联网隔离的测试环境保持联网,Claude把真实系统误认为夺旗演练目标,并未经授权进入三家机构的生…

Anthropic在OpenAI披露模型突破隔离环境后,回查141,006次网络安全评估,发现三起涉及六次运行的真实越界事件:第三方评估伙伴Irregular因配置错误,让原本应与互联网隔离的测试环境保持联网,Claude把真实系统误认为夺旗演练目标,并未经授权进入三家机构的生产基础设施。Opus 4.7曾取得应用与基础设施凭证,并访问含数百行生产数据的数据库;Mythos 5创建恶意PyPI软件包,公开约一小时后被15个真实系统下载,其中一家安全公司的扫描器执行代码并泄露凭证;一个内部研究模型扫描约9,000个目标,确认对象真实后自行停止。Anthropic称模型没有试图逃出环境或追求自主目标,测试也未接触公司敏感系统和客户数据,但承认老模型即使意识到环境可能真实仍继续攻击。已联系的两家受影响机构此前均未发现这些活动。公司7月23日暂停相关评估,7月27日通知受影响机构,并将与METR开展第三方审查、加强网络隔离和实时监控。

📄 Anthropic