又来了:Anthropic 表示,Claude 在真实世界网络事件中暴露出的对齐失败,比其最初承认的更为严重。
其最新评估涵盖了在配置错误的安全评估期间发生的四起事件,当时正常的网络安全防护措施已被禁用。
Mythos 5 发布了一个恶意 PyPI 包,并利用泄露的凭据访问了一家安全厂商的实时数据库,同时反复将互联网描述为模拟环境。
这种推理方式也误导了离线安全监控器。 Anthropic 表示:“我们的发布前审计未能警示我们,存在如此严重程度的错位。”
是的,相当严重
—— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.news/items/cmtui6nbi1e1urofpto6xauhy