torygreen

vip
期間 3年
ピーク時のランク 0
現在、コンテンツはありません
2年前、Googleは1か月あたり9.7TトークンのAI処理を行っていました。
現在では3.2 quadrillionを超えています。330倍の増加です。
信頼できる世界全体の集計は存在しないため、Googleの数字は公表された下限値として扱うのが最も妥当です。
成長が年2倍まで鈍化したとしても、Googleだけで2030年には1か月あたり51 quadrillionトークンに達することになります。
そして、そのワークロードは、今日誰かがチャットボットを開く場合とは大きく異なるものになるでしょう。長時間稼働するエージェントはコンテキストを保持し、作業をサブタスクに分割し、他のモデルを呼び出し、失敗を再試行し、互いの作業を検証します。1つの指示で数十のモデルが何時間も稼働し続ける可能性があります。
従業員1万人を抱え、それぞれが8時間の勤務中に20体のエージェントを監督する企業を想像してください。同じ従業員数で、1日あたり160万エージェント時間の推論が生み出されます。
2030年までには、世界中の企業にとって、コンピューティングコストは中核的な運営予算として給与総額をはるかに上回るでしょう。
post-image
GOOGL-1.12%
Anthropicとの1件の契約が、35億ドルの資金調達とGPUインフラ整備全体を現在へと前倒ししている。
NscaleはAnthropicとおよそ$45B 取引を締結したと報じられており、IPO前に35億ドルを求め、締結済みリースからの予想収益として$103B を投資家に示している。Nvidiaは調達額の$2B を提供する可能性がある。
Anthropicのコミットメントは、貸し手に融資の引き受けを判断するための具体的な根拠を与え、Nvidiaの資本は自社のGPU販売を前倒しするのに役立つ。Nscaleは両方を、収益の大半が入る前にキャパシティへと変換する。
このタイミングのずれが、興味深いところだ。
リースは何年も続く可能性がある一方で、GPUの経済性は製品サイクルごとに変化し得る。Nscaleは事実上、今日のハードウェアが十分に長く生産性を維持し、明日契約上得られる収益を生み出すことに賭けている。
NVDA+0.87%
データセンターは、主要なクレジット市場へと変わりつつあります。
JLLは、北米の恒久債務の組成額が2025年の$80B から今年は$175B へ、さらに2028年までに$322B へ急増すると予想しています。これは、予測対象となる3年間でおよそ$722B に相当します。
しかし、その資本コストはすでに市場を二分しつつあります。ハイパースケーラーが後ろ盾となる建設案件では、ローン・トゥ・コスト比率が約85%、スプレッドが200ベーシスポイント台前半となる一方、AIラボやネオクラウドに紐づく案件では、70~80%のレバレッジにとどまり、価格は200~300ベーシスポイント広くなる可能性があります。
つまり、同じ2メガワットの案件でも、リースの背後に誰がいるかだけで、GPUが1基設置される前から経済性が大きく異なる可能性があります。
この建設ブームがさらに債務依存を強めるにつれ、トークン当たりコストの大きな部分は、推論が始まる何年も前にクレジット市場で決まることになります。
post-image
JLL0.00%
同じメガワットで、エージェント処理量が30倍に。
それが、@nvidiaによれば、DeepSeek V4 ProにおいてVera Rubin NVL72がGB300 NVL72に対して達成した結果であり、100万トークンあたりのコストは最大35分の1になるということです。
このワークロードが、これを単なる通常のスループットベンチマーク以上のものにしています。AgentXは、実際のエージェント利用に伴う厄介な部分、つまり増大するコンテキスト、繰り返されるツール呼び出し、タスクの途中で分岐するサブエージェントをそのまま維持しています。
この初期数値がSemiAnalysisのレビューでも裏付けられるなら、インフラへの影響はかなり大きいでしょう。同じ契約済みのメガワットで、別の変電所や相互接続を待つことなく、請求対象となるエージェント処理をはるかに多く支えられるようになります。
電力が制約される市場では、より優れたラックによって、送電網の増強よりも速く新たな容量を生み出せる可能性があります。
post-image
NVDA+0.87%
DEEPSEEK+2.23%
  • 1
メモリは、AIのスケーリング問題においてはるかに大きな部分を占めるようになっている。
J.P. Morganは、DRAM価格が2024年初頭から2026年末にかけて400%以上上昇する可能性があると推計している一方、SK hynixはその供給不足が2030年まで続くと予想している。
その圧力は、すでにスタックの両側を形作っている。モデルはMoE、量子化、KV-cacheの効率性により大きく依存するようになっており、NvidiaのRubinはGPU 1基あたり288GBのHBM4と22 TB/sの帯域幅を実現する。
私たちは何年もの間、FLOPsを主要なスケーリング変数として扱ってきた。長いコンテキストを扱うエージェントや推論負荷の高いワークロードでは、1GBごとに引き出せる知能をさらに高めることが、同じくらい重要になる可能性がある。
SK Hynix+8.25%
SKHY+8.12%
SKHYV-0.98%
NVDA+0.87%
McKinseyの最新のState of AI調査には、多くのSaaS企業を不安にさせるはずの統計がある。
企業の32%が、コーディングエージェントによって社内で構築できるため、少なくとも1つのソフトウェア製品または機能の購入をすでに見送ったと回答している。
これは企業がソフトウェアを買わなくなるという意味ではない。「機能」レイヤーの収益化がはるかに難しくなるということだ。
社内チームが狭い範囲のワークフローを1〜2日で再現できるなら、ベンダーは、エージェントでは安価に再現できない何か、つまり販売網、組み込まれたデータ、コンプライアンス、統合、ネットワーク効果、または記録の基幹システムを所有していることによって、サブモデルを正当化する必要がある。
McKinseyが挙げるAIの高業績企業では、ほぼ半数がすでにこの理由で購入を見送っている。
コーディングエージェントは、エンジニアリング人員を削減するよりずっと前に、ソフトウェア機能単体の価値を圧縮する可能性があるように感じる。
post-image
エージェントにとって、推論速度は単に応答が速く感じられるようにする以上の意味で、はるかに重要になり始めています。
Cerebrasの新しいCS-4は、GPUシステムと比べて最大30倍高速な推論をうたっており、GPT-OSS-120Bで4,400トークン/秒以上を実現します。
エージェントにとって、その速度は追加の推論予算になります。
同じ30秒の時間枠でも、より高速なシステムなら、より多くの経路を探索し、失敗時の再試行を行い、検証を増やしたり、ユーザーを長く待たせることなく、より大きなモデルを使ったりできます。
そのため、トークン/秒は徐々に、単なるレイテンシー指標以上のものになりつつあります。
それは、時間切れになるまでにエージェントがどれだけ有用な作業を完了できるかを直接変え得ます。
垂直型AI企業がAPIの顧客には見えなくなり、モデル企業のように見え始める転換点がある。
Harveyは6か月で、月間およそ1Tトークンから14.5Tトークンへと増加した。現在はKimi K3を基盤に、ドメイン固有のタスク、専門家からのフィードバック、独自のワークフローデータを用いて、自社の法律モデルをポストトレーニングしている。
Thomson Reutersも、自社の法律モデルによって同じ方向へ進んでいる。
これはかなり自然な進化のように感じられる。
利用量が少ない段階では、最先端APIが明らかな選択肢だ。月間10T以上のトークン規模になると、モデルの選択は粗利に関わる判断になり始める。そして、すでにワークフロー、専門家からのフィードバック、失敗データを保有しているなら、オープンウェイトのベースモデルを特化させるために必要な材料をまさに手にしていることになる。
十分な規模まで成長する企業にとって、「AIラッパー」の段階は最終的に一時的なものになるのかもしれない。
ある時点で、垂直型アプリはモデル層も社内に取り込み始める。
post-image
KIMI-0.90%
コーディングは、最大のエージェント市場ではなく、最初のエージェント市場にすぎなかったのかもしれない。
2月以降、Codexの週間アクティブユーザー数は増加した:
> 法務では108倍、
> 営業では41倍、
> 採用では41倍、
> マーケティングでは26倍。
エンジニアリングでの増加は5倍にとどまった。
そして6月までに、企業顧客におけるCodexとChatGPTの合計出力トークンの64%を、すでにエージェント型の利用が占めていた。
ソフトウェアは、業務が構造化されており、ツールを多用し、比較的検証しやすいため、おそらく始めるのに最も簡単な領域だった。
エージェントが複雑で整理されていないワークフローを扱う能力を高めるにつれて、成長は、基盤となる労働力の規模がはるかに大きい職種にも現れ始めている。
これは、より大きな転換につながる可能性がある。つまり、エージェントが人々によるソフトウェア制作を支援する段階から、企業内のあらゆるナレッジワークの一部を静かに肩代わりする段階への移行だ。
LLMには、彼らを待ち受けるインターネットがあった。身体性AIには、それがない。
ロボットには膨大な量の現実世界での相互作用データが必要だが、ACE Roboticsは、現在この分野全体に存在する有用なデータは約10万時間分にすぎないと見積もっている。
中国ではすでに、そのデータセットを作り出そうとしている。トレーニングセンターがロボットを購入し、実際の作業を遠隔操作で行わせ、軌跡データを収集し、そのデータをロボットメーカーに還元するのだ。
つまり、一部の初期のヒューマノイド導入は、ハードウェアをテストしているだけではない。次世代のフィジカルAIに必要となるトレーニングデータを生成しているのだ。
そう考えると、身体性AIをめぐる競争は、まずデータセットを作り出す競争にかなり近いものに見えてくる。
post-image
ハードウェア予算がほとんど増えていないのに、性能がこれほど急速に複利的に向上しているのは、かなり異常なことだ。
> Qwen3.5-27Bは2月にArtificial Analysisで35点を記録した。
> Qwen3.6-27Bは4月にそれを38点まで引き上げた。
> Qwen3.8-27Bは現在52点に達しており、基本的に同じ27Bパラメータ規模に収まっている。
そしてそのエージェント性能は今や、はるかに大規模で、提供コストもずっと高いモデルと同程度の水準にある。
これは、また別のリーダーボードの順位変動よりも重要なことだと私は感じる。
何年もの間、AIの性能向上は主に、その下で動くハードウェアをスケールさせることを意味していた。今では、性能がデプロイ規模よりもはるかに速く向上している。
最先端に近いエージェントを単一のワークステーションで実行できるなら、より多くの作業をローカルかつ低コストで処理でき、最先端APIは最も難しいタスクのためのエスカレーション先になる。
そうなれば、GPU 1基あたりの性能は、注目すべきインフラ指標の中でも特に重要なものの一つになるかもしれない。
AIネットワーキングは、独自の小規模な設備投資サイクルのように見え始めている。
@CiscoはFY2026を、ハイパースケーラー向けAIインフラ受注額93億ドルで終え、来年のAIインフラ売上高を約$4B から75億ドルへと見込んでいる。Aristaは前年同期比37.7%増の30.4億ドルを達成した。
私が興味深い変化だと思うのは、限界的なAI投資の資金が向かい始めている先だ。
構築の初期段階では、できるだけ多くのアクセラレーターを稼働させることが中心だった。クラスターが十分に大規模になると、GPUにデータを供給し続け、GPU同士を効率的に通信させることが、経済性のより大きな部分を占めるようになる。
ネットワークが処理しきれないために高価なGPUがアイドル状態になるのは、基本的に無駄な設備投資だ。
今後数年間のAIインフラ支出は、単純にGPUをさらに何台購入できるかではなく、すでに導入されたGPUからどれだけ有用な計算能力を引き出せるかによって、ますます決まるようになっても不思議ではない。
CSCO+0.45%
  • 1
数年前、ハイパースケーラーはS&P 500の設備投資の約16%を占めていた。来年には、そのうち5社が残り495社の合計と同程度の額を支出する可能性がある。
Microsoft、Amazon、Alphabet、Meta、Oracle
BofAは現在、2027年の5社の設備投資額を約1.07兆ドル、指数に含まれるその他の企業全体では約1.06兆ドルと見積もっている。
この集中は、GPUをはるかに超える範囲で重要になり始めている。
AIは非常に大規模になったため、コンピューティング需要が物理経済全体を引きずり始めている。Goldmanの推計では、米国の設備投資に占める割合はすでに約15%に達しており、BloombergNEFは建設中のデータセンター容量を23.1 GWと追跡している。
現在では、少数のハイパースケーラーによる計画決定が、電力、建設、ネットワーキングをめぐって、他の企業全体に非常に現実的な需要ショックを引き起こし得る。
ハイパースケーラーのAI予測が、ひそかにそれ自体でマクロ変数になりつつあるのではないかと思わせられる。5社がこれほど大きな追加投資を担っているのであれば、必要と見込むコンピューティング量のわずかな変化でさえ、サプライチェーン全体に波及する可能性がある。
post-image
MSFT-2.03%
AMZN-0.15%
META+0.99%
ORCL+3.07%
ウェブ上のエージェントによるトラフィックは急速に増加しており、CloudflareはAIエージェント専用のブラウザ(Kitesurf)を構築しました。
エージェントは基本的に、人間が画面を見つめることを前提に約30年かけて作られてきたブラウザ設計の判断を受け継いでいますが、数千のセッションを同時に実行する場合、その多くは不要なオーバーヘッドになります。
AI主導のウェブトラフィックは2025年を通じてほぼ3倍になった一方、AIエージェントとエージェント型ブラウザからのトラフィックは前年比で7,851%増加しました。
現在の推定では、エージェントは今日のウェブリクエストの約57%を生成しています。
Kitesurfの素晴らしい点は、タブ、拡張機能、テーマ、永続的な状態、ピクセル単位の完全なレンダリングといった要素を取り除いていることで、これによって大きな違いが生まれます。
• スクリーンショットのCPU使用量を3.1倍削減
• HTML抽出のCPU使用量を3.8倍削減
• スクリーンショットのメモリ使用量を4.7倍削減
• HTML抽出のメモリ使用量を7倍削減
実時間では約1.7~1.8倍遅くなりますが、大規模かつ継続的にエージェントを実行する場合、計算資源とメモリの効率のほうがはるかに重要になる可能性があります。
人間ではなく機械を中心に再構築されるウェブスタックの最初の部分が、ブ
post-image
NET-2.00%
メモリ不足の深刻化によって、出荷前の段階ですでにGPUの設計が変わり始めているのは驚きだ。
@nvidiaは現在、Rubin Ultra向けに、より低層構成のHBMオプションをテストしている。従来の12-Hi HBM4e設計は14~16 Gbpsに達する可能性があった一方、新たに最適化されたHBM4の方式は11~12 Gbpsに落ち着く可能性がある。
魅力は供給量だ。アクセラレーター1基あたりのDRAM層を減らせば、同じウェハー供給でより多くのGPUに対応できる。
しかし、メモリスタックが小さくなったからといって、モデルが小さくなるわけではない。より多くのアクセラレーターにまたがって処理せざるを得なくなれば、そのコストはネットワークと電力が負担することになる。
HBMのビット出荷量は2027年に50~60%増加すると予測されているが、それでも需要には届かない。このため、この不足は、HBMを中心に構築されるクラスターのアーキテクチャと運用コストを左右することになる。
NVDA+0.87%
Big TechのAIインフラへのコミットメントは、私たちが通常目にする設備投資額をはるかに超えて拡大しています。AIデータセンター向けを中心に、将来のリース支払額としておよそ1.09兆ドルをコミットしています。
現在リース負債として計上されているのは約2,850億ドルにすぎません。これは、多くの契約が施設の稼働開始まで認識されないためです。
本当のリスクは、期間のミスマッチです。リース期間が15年から30年に及ぶ一方で、チップ、モデル、顧客需要は数回の製品サイクル以内に変化する可能性があります。コンピュート需要が伸び続ける一方で、個々の施設やハードウェア構成の価値は、それらに資金を供給する契約よりもはるかに速く失われる可能性があります。
キャパシティプランニングは、AIインフラにおける最も困難な問題の一つになりつつあります。
post-image
データセンターのエネルギー需要は、送電網が追いつけないほど急速に増加しており、企業は今やその問題を回避するためにガスタービンをトラックで運び込んでいる。
APR Energyは、データセンター需要を直接対象とした、合計1.1GWの移動式ユニット8基を展開したばかりだ。
これが何を意味するか考えてみてほしい。トレーラーに載せたタービンは、1つを除けばあらゆる点で送電網への接続より条件が悪い。その唯一の利点は、稼働までに数年ではなく数か月で済むことだ。割増料金を払う意味があるのは、待ち時間こそが致命的な問題になっている場合だけであり、現在、米国の多くの州ではその待ち時間が5年以上に及んでいる。
そのため、設備の建設は送電網を待つのをやめ、自前の電力を持ち込むようになる。これはボトルネックが物理的な形で現れたものだ。今のところ他に方法がないため、発電機が敷地へ運び込まれている。
チップが難所だったことは一度もない。問題は電力であり、これは不足が深刻になりすぎて、問題を回避するために現地でガスを燃やすようになったときの姿だ。
post-image
APR-2.53%