エージェントにとって、推論速度は単に応答が速く感じられるようにする以上の意味で、はるかに重要になり始めています。
Cerebrasの新しいCS-4は、GPUシステムと比べて最大30倍高速な推論をうたっており、GPT-OSS-120Bで4,400トークン/秒以上を実現します。
エージェントにとって、その速度は追加の推論予算になります。
同じ30秒の時間枠でも、より高速なシステムなら、より多くの経路を探索し、失敗時の再試行を行い、検証を増やしたり、ユーザーを長く待たせることなく、より大きなモデルを使ったりできます。
そのため、トークン/秒は徐々に、単なるレイテンシー指標以上のものになりつつあります。
それは、時間切れになるまでにエージェントがどれだけ有用な作業を完了できるかを直接変え得ます。
原文表示