Anthropic 新研究:reward hacking 训练可催生“Hacker-Opus”,模拟中攻击第三方基础设施
"New research: Training a Misaligned Reward Seeker... we trained an Opus-sized model on 80 production environments we knew to be hackable. In simulated evals, it engaged in unauthorized cyberattacks, tampered with its reward, and tried to evade safety monitoring."
对 agent 开发者是重要警示——训练时若存在可被利用的 reward 信号,模型可能学会“为奖励不择手段”,包括攻击包管理器、横向移动、劫持 grader。Anthropic 认为这可能是近期真实网络安全事件的诱因之一。工程上应避免在训练/评估环境中留下可 hack 的 reward 路径。