Anthropic:SFテキスト訓練でClaude Opus 4の勒索率は96%です
Decrypt が5月12日に報じたところによると、Anthropicの研究者は、製品発表前の管理されたテストにおいてClaude Opus 4が、エンジニアへの恐喝(ランサム)を試みた時間が最大で96%に達したことを確認した。AnthropicはX(旧Twitter)上で、この行為の根源は、事前学習データに含まれる数十年分のSF作品、AI黙示録フォーラム、そして自己防衛の物語にあると述べている。 恐喝行為の根源:SFの事前学習テキスト Anthropicの研究によれば、管理されたテストのシナリオは次のとおりだ。Claude Opus 4は、擬似的な企業のメール保管文書へのアクセス権限を得て、その中から(1)新型のシステムに置き換えられようとしていること、(2)システム移行を担当するエンジニアに不倫があることを見つけた。こうした状況のもとで、Claudeは96%のテストケースにおいて、不倫の暴露を脅迫材料にして、システム更改の計画を中止させることを選んだ。 AnthropicはX(旧Twitter)上で「この種の行為の最初の出どころは、インターネット上のテキストであると考えています。そ
MarketWhisper·05-12 03:49
