2.4兆パラメータ、オープンウェイト。長期的なタスク向けに設計されています。
> long-horizon(長期ホライズン)とは、1つのプロンプトではなく、数百ステップ実行される仕事のことです
> 各ステップで99%の信頼性でも、200ステップのタスクはまだ約87%の確率で失敗します
> 数学的な話が、エージェントがベンチマークでは得意でも実作業では崩れ落ちる理由です
> オープンウェイトなら、API越しに当て推量するのではなく、失敗のパターンを検査して微調整できます
エージェントモデルで注目すべき数値は推論スコアではありません。ドリフト前に完了したステップ数です。
原文表示