廣場
最新
熱門
新聞
我的主頁
發布
0xOverleveraged
2026-04-24 22:08:11
關注
我注意到一個有趣的趨勢——廉價代幣的時代正式結束了。以前,當大公司補貼API時,我們都像國王一樣生活。向提示中投放數千個詞,讓GPT-4做一些荒謬的小事,比如“將第一個字母大寫”。為什麼?因為很便宜。但風向已經改變。
現在,計算能力的帳單已成為現實。NVIDIA H100——這是地緣政治的衝突,而不僅僅是商業競爭。每次API調用都花費真實的金錢。代幣——不僅僅是一個單位,它真的像黃金一樣。
問題在於,大多數團隊並不真正理解錢從哪裡流出來。人們在月底看帳單時會感到震驚。損失隱藏在最不明顯的地方。你禮貌地與模型交流——你好,謝謝,請。可是每個詞,每個空格——都是你付錢的代幣。提示系統在每次會話中積累、重複,你為已經付過錢的內容付費。
RAG(檢索增強生成)經常變成災難。理想情況是抽取三個相關句子。實際操作中——用戶提出請求,系統卻向模型投放十份每份一萬詞的PDF文件。開發者想:讓模型自己找吧。這不是懶惰,而是對計算能力的犯罪。不相關的上下文信息不僅會干擾注意力機制,還會導致天文數字的代幣消耗。
失控的代理已經是極端。當AI陷入錯誤循環時,它會無限旋轉,消耗昂貴的輸出代幣。沒有正確的緊急停止機制,這可能在一夜之間耗盡你的信用卡。
但有解決方案。語義緩存——最簡單的方法。用戶請求經常是類似的。不要每次都調用GPT-4,而是檢查與緩存的相似性。如果有人已經提出過類似的問題——直接拿現成的答案。零代幣消耗。延遲從幾秒變成毫秒。
提示壓縮是第二層。基於信息熵的算法分析哪些詞是關鍵,哪些是多餘的。可以將千詞的文本壓縮到三百詞,同時保持內容。讓機器用機器語言交流——對人來說笨拙的東西,對模型來說完全可以理解。
模型路由——對架構師來說是最大考驗。不要把所有任務都放在最昂貴的模型上。對於簡單的格式轉換或翻譯——路由到便宜的API或本地部署的小模型。成本幾乎消失。複雜的邏輯推理——那就用強大的工具。就像一個良好運作的公司:前台不會把請求直接傳給CEO。
這裡才是真正有趣的——看看OpenClaw和Hermes。這些代理理解有限資源的現實。OpenClaw幾乎控制了代幣,幾乎到了偏執的程度。用JSON Schema強制輸出,而不是自由文本。AI不再交流,它在填表。乍看之下——這是為了方便解析,但實際上是對流量的外科手術式節省。
Nous Research的Hermes展示了執行指令的準確性。一次做對事——是最大的節省。在多步交互中,它們不會保存全部歷史。工作記憶只存最近的3到5條消息。當窗口溢出時,輕量模型會對幾個關鍵句子進行摘要,並存入向量庫。舊對話被刪除,但知識仍在。這不是扔垃圾,而是進行外科手術式的記憶清理。
現在的關鍵點——這不是技術問題,而是思維轉變。以前我們把代幣當作超市的消費品。看到折扣就放進購物車。公司盲目將大型語言模型接入一切,甚至用於餐廳菜單。現在需要轉向投資思維。每個代幣都是投資。它帶來了什麼?提高了工單完成率嗎?縮短了修復錯誤的時間嗎?
如果基於規則的功能成本是10美分,而大型模型每個代幣1美元,但只提高2%的轉化率——那就刪掉它。毫不猶豫。停止追求龐大且全方位的AI解決方案。尋找小巧且精確的高效打擊。當業務問:能讀完10萬份報告並提供摘要嗎?你應該反問:你的收入能否覆蓋幾百萬代幣的API費用?
計算吧。節省吧。像店主一樣計算代幣。聽起來一點也不科幻——更像是農業。但這是走向AI成熟的必要階段。無限制免費使用的時代已經結束。現在贏家是那些理解架構、路由,並能最大化利用每一滴計算能力的人。當潮水退去,就能看到誰光著身子游泳。這次,廉價代幣的潮水正在退去。只有像挖掘每一滴都像黃金一樣的人,才能獲得真正的護甲。
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見
聲明
。
打賞
按讚
回覆
轉發
分享
回覆
請輸入回覆內容
請輸入回覆內容
回覆
暫無回覆
熱門話題
查看更多
#
直通IPO第二期JerseyMikes
175.72萬 熱度
#
夏日創作營
148.23萬 熱度
#
事件合約首發狂歡
13.35萬 熱度
#
布倫特原油重返100美元
156.32萬 熱度
#
英特爾Q2營收創15年最快增速
13.97萬 熱度
已置頂
網站地圖
我注意到一個有趣的趨勢——廉價代幣的時代正式結束了。以前,當大公司補貼API時,我們都像國王一樣生活。向提示中投放數千個詞,讓GPT-4做一些荒謬的小事,比如“將第一個字母大寫”。為什麼?因為很便宜。但風向已經改變。
現在,計算能力的帳單已成為現實。NVIDIA H100——這是地緣政治的衝突,而不僅僅是商業競爭。每次API調用都花費真實的金錢。代幣——不僅僅是一個單位,它真的像黃金一樣。
問題在於,大多數團隊並不真正理解錢從哪裡流出來。人們在月底看帳單時會感到震驚。損失隱藏在最不明顯的地方。你禮貌地與模型交流——你好,謝謝,請。可是每個詞,每個空格——都是你付錢的代幣。提示系統在每次會話中積累、重複,你為已經付過錢的內容付費。
RAG(檢索增強生成)經常變成災難。理想情況是抽取三個相關句子。實際操作中——用戶提出請求,系統卻向模型投放十份每份一萬詞的PDF文件。開發者想:讓模型自己找吧。這不是懶惰,而是對計算能力的犯罪。不相關的上下文信息不僅會干擾注意力機制,還會導致天文數字的代幣消耗。
失控的代理已經是極端。當AI陷入錯誤循環時,它會無限旋轉,消耗昂貴的輸出代幣。沒有正確的緊急停止機制,這可能在一夜之間耗盡你的信用卡。
但有解決方案。語義緩存——最簡單的方法。用戶請求經常是類似的。不要每次都調用GPT-4,而是檢查與緩存的相似性。如果有人已經提出過類似的問題——直接拿現成的答案。零代幣消耗。延遲從幾秒變成毫秒。
提示壓縮是第二層。基於信息熵的算法分析哪些詞是關鍵,哪些是多餘的。可以將千詞的文本壓縮到三百詞,同時保持內容。讓機器用機器語言交流——對人來說笨拙的東西,對模型來說完全可以理解。
模型路由——對架構師來說是最大考驗。不要把所有任務都放在最昂貴的模型上。對於簡單的格式轉換或翻譯——路由到便宜的API或本地部署的小模型。成本幾乎消失。複雜的邏輯推理——那就用強大的工具。就像一個良好運作的公司:前台不會把請求直接傳給CEO。
這裡才是真正有趣的——看看OpenClaw和Hermes。這些代理理解有限資源的現實。OpenClaw幾乎控制了代幣,幾乎到了偏執的程度。用JSON Schema強制輸出,而不是自由文本。AI不再交流,它在填表。乍看之下——這是為了方便解析,但實際上是對流量的外科手術式節省。
Nous Research的Hermes展示了執行指令的準確性。一次做對事——是最大的節省。在多步交互中,它們不會保存全部歷史。工作記憶只存最近的3到5條消息。當窗口溢出時,輕量模型會對幾個關鍵句子進行摘要,並存入向量庫。舊對話被刪除,但知識仍在。這不是扔垃圾,而是進行外科手術式的記憶清理。
現在的關鍵點——這不是技術問題,而是思維轉變。以前我們把代幣當作超市的消費品。看到折扣就放進購物車。公司盲目將大型語言模型接入一切,甚至用於餐廳菜單。現在需要轉向投資思維。每個代幣都是投資。它帶來了什麼?提高了工單完成率嗎?縮短了修復錯誤的時間嗎?
如果基於規則的功能成本是10美分,而大型模型每個代幣1美元,但只提高2%的轉化率——那就刪掉它。毫不猶豫。停止追求龐大且全方位的AI解決方案。尋找小巧且精確的高效打擊。當業務問:能讀完10萬份報告並提供摘要嗎?你應該反問:你的收入能否覆蓋幾百萬代幣的API費用?
計算吧。節省吧。像店主一樣計算代幣。聽起來一點也不科幻——更像是農業。但這是走向AI成熟的必要階段。無限制免費使用的時代已經結束。現在贏家是那些理解架構、路由,並能最大化利用每一滴計算能力的人。當潮水退去,就能看到誰光著身子游泳。這次,廉價代幣的潮水正在退去。只有像挖掘每一滴都像黃金一樣的人,才能獲得真正的護甲。