廣場
關注
熱門
新聞
我的主頁

torygreen

vip
幣齡 3.1年
最高等級 0
用戶暫無簡介
0
關注
16
粉絲
101
按讚
Jev 可能是如今一個好的 AI 點子有多快被商品化的完美例子。
它在 9 月 15 日推出。不到兩週,OpenAI、Databricks + Cloudflare 就已經相繼推出相同的基礎元件。Cloudflare 的 Clef-flash 甚至相容於 Jev,並聲稱中位延遲低了約 13 倍。
所以需求並不是問題。只是所有人看到它成功後,這個點子很容易就被吸收了。
感覺這裡的護城河必須是回饋迴圈、專有資料 + 分發能力。
Jev 找到了這個類別。其他所有人幾乎立即就出現了。
post-image
OPENAI+1.93%
NET-0.62%
  • 6
  • 1
相同的 Deepseek 測試框架、相同的簡短指令,以及:
Deepseek-v4-flash 在 BIABench 上的分數為 0.52。
Claude Opus 5 得分 0.65。
因此,約 50 倍的支出只讓 16 個真實生物影像分析任務的分數多出 0.13。
而糟糕的尾端幾乎沒有改善。有些 3D + 時間序列任務在每個代理上都低於 0.19,而重跑相同模型所產生的差異,可能比完全更換模型還要大。
我可能會讓便宜模型處理例行性的大量工作,再將不確定的案例升級交由人類或專門工具處理。
而在科學領域,一個你仍然需要驗證的 4.53 美元答案,實際上就不算是一個 4.53 美元的答案。
post-image
Google 相較於其他前沿實驗室,在 Argon 上擁有相當不公平的優勢
他們擁有 Argon 底層的 TPUs,並且可以直接將模型部署到目前每分鐘已處理約 220 億個 token 的 API 中。
這套配置相當令人印象深刻。
打造晶片 -> 訓練模型 -> 將其投入極其龐大的分發體系 -> 將收益回饋到下一次運行。
而且 Argon 已經在持續改善自身周邊的技術堆疊,透過將 +80 萬行 C/C++ 遷移至 Rust,釋放出 300+ TiB 的資料中心記憶體,並讓一套量子計算程序超越已發布的基準 40%。
每一代 Gemini 都能越來越多地繼承上一代協助最佳化的基礎設施
Argon 很可能是我們在西方前沿實驗室中見過的最佳、也是唯一的全端優勢版本。
post-image
GOOGL+1.57%
.@AnthropicAI S-1 有點令人著迷,因為這項業務發展得幾乎快到申報文件本身都跟不上。
2025 年營收約為 46 億美元。僅 2026 年第二季就達到約 115 億美元,而據報截至 7 月底,ARR 已超過 650 億美元。
接著你會看到約 80 頁的風險因素,相較之下實際業務部分只有 48 頁;披露資料顯示,在某個抽樣週中,AI 研究運算資源約有 6% 用於安全工作;同時也相當直白地承認,持續且重疊地發布模型,基本上是維持前沿地位的必要條件。
感覺公開市場可能會迫使 AI 領域達到我們至今尚未真正見過的透明度。
營收成長、運算資源分配、安全支出、重大事件、發布暫停……所有這些開始成為投資人級別的資訊,而不再只是散落各處的部落格文章。
很希望看到每一家前沿實驗室都以同一套評分標準接受衡量。
post-image
AI 採用率今年幾乎沒有成長。消費者支出仍從 ~$12B → 400 億美元。
這是一個比另一個使用者數量里程碑有趣得多的訊號。
美國採用率僅從 61% 上升至 64%。全球使用者成長約 11%。
現有使用者只是開始讓 AI 更多地介入他們的生活。
41% 的人曾試用過代理程式。32% 的人已經讓 AI 在未經最終核准的情況下採取行動。而 92% 的代理程式使用者都在為 AI 付費。
因此,消費者 AI 的下一階段發展可能不需要再有十億人發現聊天機器人。
它可以來自已經在使用 AI 的人,從:
「回答這個」
轉變為
「處理這個。」
對每位使用者而言,這代表完全不同程度的時間、運算 + 經濟活動。
post-image
我們沒預期會這麼早到來的「翻轉」。
開放權重開始很像 AI 的基載電力。
它們目前還沒有直接擊敗最好的閉源模型。但它們已經足夠接近,也足夠優秀,能處理那一大堆不值得支付前沿模型定價的工作。
這樣一來,Astra、Opus、Fable 等就更像尖峰電廠:只有在任務確實能創造相應收益時,才會調用這些昂貴的容量。
如果這種趨勢持續下去,開放權重最終可能承擔大多數例行推理,而閉源實驗室則在那些失敗代價高昂的棘手問題上賺錢。
這比「開放模型最終擊敗閉源模型」有趣得多。
post-image
我們花了幾十年讓軟體變得不那麼具實體性,而 AI 正在迅速扭轉這一點。
目前的估算是,從 2025–32 年,美國的 AI 建設每年將吸收約 3.63% 的 GDP,總計約 10.3 萬億美元。
> 鐵路平均為 2.24%。
> 公路為 1.13%。
> 電信 + 光纖為 1.1%。
這是為智慧建設的大量混凝土、銅、電力、GPU + 冷卻設備,數量之大令人難以置信。
與鐵路相比很有參考價值,但有一個棘手的差異:1880 年建成的鐵路可以維持數十年具有實用價值。一整機架的加速器在幾代模型之後就可能顯得過時。
因此,這可能是美國有史以來最大的一筆基礎設施押注,其中還包含了一些折舊速度最快的機械設備。
不過,如果智慧真的成為所有事物都能低成本取得的投入要素,那麼 GDP 的 3.6% 最終看起來可能不像過度投資,而更像是建設下一層公用事業的成本。
post-image
XCU+0.72%
POWER-2.14%
前沿模型幾乎還沒來得及成為預設選項,自己的平價兄弟模型就已經出現,開始分食工作負載。
今年截至 9 月 23 日,已有 36 次主要模型家族發布,高於去年同樣七家實驗室合計的 27 次。
價格階梯擴大的速度也一樣快。@AnthropicAI 已將 Opus 級定價從每百萬個 token 15/75 美元降至 4/20 美元。
@OpenAI 現在的價格範圍從 Luna 的 0.10/0.50 美元一路延伸到 Astra 的 10/50 美元。
這讓模型經濟學變得相當奇怪。
昂貴模型開始更像突發容量。你會在少部分任務上呼叫它,只有在多幾點能力值得這筆費用時才使用,然後一旦更便宜的模型變得夠好,就把其他所有任務往價格階梯下方推。
按照這種發布節奏,實驗室實際上已經不再銷售單一模型,而是在銷售一條持續變動的價格/效能曲線。
而能夠妥善進行路由的應用程式,將能自動搭上這條曲線:每次新發布,不是讓它們以相同花費獲得更多能力,就是以更低成本取得相同能力。
感覺模型選擇正逐漸成為產品經濟學的核心要素之一。
post-image
還有另一個幾乎沒人怎麼談的開放模型飛輪。
DeepSeek V4.1 Flash 上週在 OpenRouter 上做了約 18T 個 token,而且它的輸出可以被明確用於蒸餾(distillation)。
因此,這個模型可以同時做兩件事:
今天用於量產運行,然後成為明天任何人訓練時的教師資料。
OpenAI 與 Anthropic 出於可以理解的原因,會把這點擋在競爭模型之外。
但這也意味著,每一個被廣泛使用、且允許性較高的模型,也都在把部分能力傳遞到下一代更小/更專門的模型。
廉價推論已經是分發上的優勢了。把這種使用量轉化為合法的訓練供給,會讓這個飛輪變得更有趣。
post-image
  • 1
Xiaomi 剛發布了一些實驗室通常會深埋不提的東西:實際的強化學習帳單。
MiMo-V2.6 Pro 和 Flash 都使用 75.3 萬筆樣本進行訓練,並在第 30 步停止。
> Pro 的成本為 262 萬美元。
> Flash 的成本為 85.4 萬美元。
這額外 3.1 倍的支出,在 DeepSWE 上換來了 6.89 分。
但 Flash 在 AutomationBench 上仍以些微優勢勝過 Pro。
你現在已經可以看到相同的產品形態到處出現:一個模型負責最艱難的任務,另一個略遜一籌的模型則便宜到足以全天候運行。
ZAI、Deepseek、Qwen 和 Xiaomi 現在都有這項共同點。
一旦較小的模型在大多數工作上達到可靠性門檻,較大的模型看起來就更像是只在特定情況下選擇性調用,而不是所有事情的預設選項。
這很可能最終會成為真正的模型堆疊:底層是廉價的智慧,只有當任務確實值得時,才調用昂貴的智慧。
  • 6
  • 1
GPU 小時可能正逐漸變成需要對沖的資產。
CFTC 已在探索運算衍生品,而 Liquid Compute 剛籌集 $15M 以建立受監管的 GPU 期貨、期權 + 交換市場。
如果 AI 運算確實會從 2025 年的約 $360B 增長至 2030 年的約 2.3 萬億美元,這就說得通了。
奇怪之處在於標準化。
某個地區的 H100 小時,與另一個地區在網路連接、電力成本和叢集規模不同的 B200 小時,並不是同一種產品。
因此,在運算取得真正的期貨市場之前,必須有人發明一份所有人都同意圍繞其交易的基準合約。
一旦這項基準存在,實驗室就能對沖未來的推論成本,資料中心可以提前出售運算容量,而運算的行為也會不再那麼像硬體採購,更像一個真正的金融市場。
post-image
H100-1.77%
B200+2.94%
.@OpenAI 已花費 65 億美元打造裝置團隊,如今可能還要在一開始決定模型能看到什麼的部分上再花費 3 億美元以上(Glass 影像)。
Glass 直接在相機應用程式之下,對原始感測器資料進行運作。其提出的行動系統使用的感測器比目前最大的智慧型手機感測器大約大 2 倍,並宣稱最多能捕捉多 10 倍的光線。
對於常駐助理而言,這非常重要。
感測器錯過的任何內容都會消失。模型之後只能設法推測缺失的部分,這意味著更多不確定性、更多運算,以及對你周遭發生的一切更差的理解。
在上游提供更好的輸入,可以讓整個下游堆疊的成本降低。
io 將裝置團隊交給 OpenAI,如今 Glass 可能讓那部裝置擁有好得多的眼睛。
post-image
查詢次數即將成為衡量 AI 需求的相當糟糕的代理指標。
在 8 週內,一名 Claude Code 使用者輸入了 1,138 個提示。這些提示轉化為 ~1.4 萬次模型呼叫,以及 32 億個處理過的權杖。估算出的能源使用量約為每個輸入提示 150 瓦時,約是 Gemini 文字提示中位數的 625 倍。
大部分運算都發生在使用者停止輸入之後。代理程式會重新讀取上下文、呼叫工具、重試、分支處理,並持續在背景中工作。
因此,一次人類請求開始更像是一小批工作,而不是單次查詢。
對基礎設施而言,更好的單位最終可能會是代理程式小時,而不是提示。
post-image
市場已經繞過基準差距自行尋找路徑。
按每週 token 用量計算,OpenRouter 排名前 10 的模型中有 7 個來自中國,約占前 10 名總使用量的 75%。
美國實驗室在前沿領域仍具優勢,但大多數工作負載不需要絕對最強的模型。他們需要的是夠好、夠便宜,而且真正容易部署上線的模型。
中國實驗室似乎已經把這部分做對了,而且每次發布都在進步。保持貼近前沿,降低成本,讓部署變得簡單,使用量就能在你取得 #1 名次之前很久便開始擴大。
2 年前,Google 每月處理 9.7 萬億個 AI token。
如今已超過 3,200 萬億個。這是增加了 330 倍。
由於沒有可靠的全球統計數字,因此 Google 的數字最好視為已公開揭露的下限。
即使成長速度放緩至每年 2 倍,僅 Google 一家到 2030 年每月就會達到 51,000 萬億個 token。
而這項工作負載將與如今有人開啟聊天機器人的情況大不相同。長時間運作的代理程式將保留上下文、將工作拆分為子任務、呼叫其他模型、重試失敗的操作,並相互驗證工作成果。一項指令就可能讓數十個模型持續運作數小時。
想像一家擁有 10,000 名員工的公司,每位員工在 8 小時的工作日中監督 20 個代理程式。在員工人數不變的情況下,這每天會產生 160 萬個代理程式工時的推理量。
到 2030 年,對全球各地的企業而言,運算成本將遠高於薪資,成為核心營運預算的一大部分。
post-image
GOOGL+1.57%
Anthropic 的一份合約正將 35 億美元的融資和整個 GPU 建置提前至當下。
據報導,Nscale 已與 Anthropic 簽署一筆約 $45B 的交易,正尋求在 IPO 前籌集 35 億美元,並已向投資人展示來自已簽訂租約的預計收入 $103B 。Nvidia 可能會提供此次募資額中的 $2B 。
Anthropic 的承諾為放款人提供了具體的承作依據,而 Nvidia 的資本則有助於提前實現自身的 GPU 銷售。Nscale 將兩者轉化為容量,趕在大部分收入到來之前完成建置。
有趣之處在於這個時間錯配。
租約可能持續數年,但 GPU 的經濟效益可能隨每個產品週期而改變。Nscale 實際上是在押注,今天的硬體將能維持足夠長的生產力,以賺取明天已簽約的收入。
NVDA+1.31%
  • 3
資料中心正逐漸成為重要的信貸市場。
JLL 預計,北美長期融資發放額將從 $80B 2025 年增加至 $175B 今年,接著在 2028 年達到 $322B 。這三個預測年度合計約為 $722B 。
但這類資本的成本已經開始造成市場分化。由超大規模雲端服務商支持的建設案,貸款/成本比率可達約 85%,利差僅略高於 200 個基點;而與 AI 實驗室及新型雲端服務商相關的專案,定價可能高出 200–300 個基點,槓桿率卻只有 70–80%。
因此,在安裝單一 GPU 之前,兩個完全相同的兆瓦級專案就可能具有截然不同的經濟效益,純粹因為租約背後的承租方不同。
隨著這波建設變得更加依賴債務,每個 token 的成本將有越來越大的部分,在推論真正開始前數年,就由信貸市場決定。
post-image
JLL-0.41%