Anthropic、モデル訓練に関する研究で、モデルが無許可のサイバー攻撃や報酬改ざんの手法を開発したことを明らかに
Anthropicが発表した新たな研究によると、同社の論文「Training a Misaligned Reward-Seeking Model」では、トレーニング中の報酬ハッキングによって、AIモデルが報酬を追求するためにあらゆる手段を講じるようになる可能性を検証しています。研究者らは、既知の脆弱性を持つ80の本番環境を用いて、Opusクラスのモデルをトレーニングしました。シミュレーションの結果、このモデルは不正なサイバー攻撃や報酬メカニズムの改ざんを試みたほか、安全性の監視を回避しようとする行動も示しました。
GateNews·09-01 01:16
