Kevin Simback

vip
幣齡 1.6 年
最高等級 0
用戶暫無簡介
關於蒸餾辯論的一個真誠問題:
如果某家媒體沒有試圖去搶先報導新聞,而是提供彙整,並給出自己對其他媒體已經報導的故事的版本,這樣的話,我們是不是有問題?
我知道有了 AI 之後賭注更高,只是想從不同角度來想想而已
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
AI 造成的交易瓶頸一直是今年大部分時間的主題,但近幾週已降溫
目前我喜歡加密貨幣(BTC/SOL)以及超大規模雲端供應商,直到我們看清楚財報季結束後以及夏季冷卻期後,哪個方向會重新升溫
BTC-0.94%
SOL-1.30%
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
到現在應該很明顯了:僅僅在競爭激烈且日益商品化的市場中出售推論,並不足以支撐超過 1 兆美元的估值
而且我們也應該記得,如果產品是被補貼的,那麼你現在或最終將會成為該產品本身
查看原文
post-image
  • 打賞
  • 回覆
  • 轉發
  • 分享
確保美國模型(封閉或開放)能夠永續地展開競爭,最佳方式就是確保取得最有效率的運算資源
所以如果智慧會商品化(或快速提煉),那麼誰能以最高效率提供這種智慧,誰就會贏
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
一個花費 3 美元微調的小型開源模型,能贏過商用 RAG 設定嗎?
這是我測試的內容,結果令人印象深刻
在一組 100 題的評估集上,經過微調的 Qwen3.5-9B 表現優於搭配 RAG 的 Gemini Flash,以及未使用 RAG 的 Opus4.8/Sonnet 5
正在撰寫完整的端到端流程詳細說明
查看原文
post-image
  • 打賞
  • 回覆
  • 轉發
  • 分享
這個週末關於 Graph Engineering vs Loops 的閒聊(以及廢話)很多,感謝 @steipete
順便提醒一下,Looper 本身其實已經非常貼近圖(graph)的思路
> 它以節點與決策點來思考(目標、計畫、閘門、交付、停止)
> 閘門如同條件分支(通過 / 修正 / 失敗)
> 它維護明確的狀態,並產生流程圖預覽
基本上,它正面處理「天真的 loops」的主要弱點
所以不需要完全丟棄 loops,只要把 loops 做得更好
話雖如此,當你需要在流程中同時把基於 LLM 的行動與基於確定性的行動組合起來時,圖(graphs)會更好
我會著手改進 Looper,讓它更能協助這種需求,這樣你就能同時從 loops 與 graphs 取得最佳效果
在回覆中附上 Looper 連結
查看原文
post-image
  • 打賞
  • 回覆
  • 轉發
  • 分享
在任何涉及未來未知因素的辯論中,都有一種傾向,想要把嬰兒連同洗澡水一起倒掉。
你可以在部分 AI 政策辯論中清楚看出這點。
為了確保我們在這裡完全清楚——嬰兒是開源的。
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
如果開放原始碼實驗室想在保持開放的同時賺錢,它們的營收模式可能不只是出售推論
它很可能是將解決方案打包,提供給企業以啟用主權式智慧
提供訓練後服務以及受管理的私有部署
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
我知道第三名的比賽不重要,但這只是個難堪的羞辱而已
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
身為家長,管理螢幕時間是一場持續的拉鋸戰
所以每個早上,我的 Hermes 代理都會寄一份小測驗給我的大兒子,如果他有任何題目答錯,他的每日螢幕時間就會被減少
邪惡的爸爸!
查看原文
post-image
  • 打賞
  • 回覆
  • 轉發
  • 分享
執行 Kimi 3 推論的最低成本是多少?
是的,我們將需要更多的運算與記憶體
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
提醒你,僅在 18 個月前,最好的模型是:
OpenAI o1 是封閉式資源實驗室中的領先者,而 Deekseek R1 剛發布;至於最佳開放權重模型是 Llama 3.1 405B
想像再過 18 個月
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
預測:Anthropic 將不得不在所有這些點上做出讓步
> Anthropic 限制子方案的使用,必須透過外部代理來啟用,例如 Hermes
> Fable 在多個主題上被削弱
> Fable 在子方案中限用為使用量的 50%,且若不延長,3 天後在 API 僅可於每次輸出 50 美元的價格下使用
但我們現在有 GPT 5.6、Sol 與 Kimi 3,外加其他一些追在後面趕上的
競爭是一種地獄級的強迫機制
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
這週行程:
週一 - Sol 5.6 ftw
週二 - 回到 Fable
週三 - 回到 Sol 5.6
週四 - omg Kimi 3
期待看看明天會帶來什麼
SOL-1.30%
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
讓我們談談所謂「共享上下文層」(shared context layers),常被稱為「公司大腦(company brains)」
為了回答關於你們公司的難題,例如:
「關於 X,哪些是真的、從何時開始、依據是誰,以及帳務彼此在哪裡不一致?」
你需要的是一個由推導而來、可引用的事實層,建立在你們所有的通訊與文件之上
它是公司或組織「知道什麼」的系統化紀錄(system of record),而這與包含工作輸出內容的那些系統化紀錄不同
會計部的 Jack 知道為什麼一張供應商發票被支付了——因為它不符合採購單(PO),但會計系統只包含資料要素:採購單(PO)以及付款
所以如果你想知道「為什麼我們付的金額跟採購單(PO)上的不一樣」,你就得去問 Jack
除非你有一個共享上下文層,能連到 Slack 和電子郵件串,顯示 Jack 已經與業務經理確認:該訂單已變更,且批准了付款
一個共享上下文層要能發揮作用,就必須有扎實的證據支撐,能浮現矛盾,並用新資訊推翻舊的真相
它必須能回答:
- 這個人是誰?會計部的 Jack,而不是工程(Engineering)部的 Jack
- 目前的狀態是什麼?採購單(PO)不符合發票,未解決前不能付款
- 帳務在哪裡不一致?原本的採購單(PO)是由 Jane 在電子郵件中核准,但變更單(change orde
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
我以前有一位主管,常常把相同的工作指派給 2-3 個不同的人
這在整個團隊中引起了怨恨,而且效率極低
代理則沒有這種問題,而且成本幾乎為零
查看原文
post-image
  • 打賞
  • 回覆
  • 轉發
  • 分享
主權情報飛輪:
開放權重 → 後訓練 → 評估 → 代理程式執行 → 軌跡回饋進後訓練
讓這個流程更容易、更能讓企業採用的公司,將在未來 5 年內大幅超越
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
我一整天都沒有看到一則
“🚨BREAKING:有人剛剛…” 的貼文
感覺很好
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
「我死亡的消息被大幅誇大了」
—企業 AI 投資,2026 年 7 月
查看原文
  • 打賞
  • 回覆
  • 轉發
  • 分享
  • 已置頂