OpenAIの評価フレームワークがGPT-5.6のパフォーマンスを損なったと主張されているが、Opus 5は2.3倍のスコアを記録した。
Beatingのモニタリングによると、最近OpenAIは、ARC-AGI-3評価フレームワークがGPT-5.6 Solのこれまでの推論を保持せず、長いコンテキストウィンドウの中で初期の記録を削除したため、モデルが発見したパターンを繰り返し忘れてしまっていると主張(クレーム)しています。OpenAIのResponses APIを使って、保存された履歴と圧縮されたコンテキストでフレームワークを再構築したところ、GPT-5.6 Solのスコアは13.3%から38.3%に改善し、出力トークンは約6分の1に削減されました。 しかし、AnthropicのOpus 5も同じフレームワークを使っており、High reasoningモードでは30.2%を記録しています。これはMaxモードでもなお13.3%のGPT-5.6 Solのスコアを2倍以上上回っており、フレームワークが両モデルに同じように影響するとは限らないことを示唆しています。
GateNews·07-30 09:05
