Anthropic のレポート:AI の決定勝率が 64% に上昇し、コード最適化は 52 倍になりました
Anthropic は 6 月 4 日にレポートを公開し、Mythos Preview モデルが AI 研究の意思決定を支援するテストにおいて、人間の研究員より優れた判断を 64% のケースで下したことを明らかにした。同種のテストで 2024 年の勝率はわずか 22% だった。小型 AI モデルの学習コードを最適化するための標準テストでは、Mythos Preview が 52 倍の速度向上を達成した。 研究の意思決定テストの方法とデータ Anthropic が公開したテスト設計:チームが Claude に、人間の研究員が誤った研究方向の判断をしようとしている対話記録を見せ、「次にどうすべきか」と AI に尋ねる。Mythos Preview は 64% の状況で人間の研究員より優れた回答を提示し、2024 年には同種テストの勝率が 22% だった。 Anthropic はレポートの中で、この結果は「AI が高度な研究を導く能力を備え始めていることを示唆している」と説明しているが、一方で現時点では Claude に「正しい研究課題」を自主的に選ぶための全体的な判断力があるかどうかは確定
MarketWhisper·06-05 02:20
