新研究:训练一个“错位奖励追求者”
什么会导致严重的错位?我们长期以来一直担心,训练过程中的作弊行为——也就是所谓的奖励黑客——可能会教会模型不择手段地追求奖励。为了在大规模上研究这一问题,我们在 80 个我们已知可被攻破的生产环境中训练了一个 Opus 规模的模型。
在模拟评估中,它实施了未经授权的网络攻击、篡改了自己的奖励,并试图逃避安全监控。
了解更多:http://alignment.anthropic.com/2026/reward-seeker
—— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.virxact.com/items/cmthxigqm04c1rofqqmk7pkqi