能跑在本地的開源模型 2 個月能達到 openai astra 目前的水準嗎?
《The Information》援引知情人士稱:Astra 使用了有限的循環深度(recurrent depth / looped transformer)——生成下一個 token 前,同一組層會對內部狀態多跑幾圈;報導將此描述為提升表現、同時減少可見思維鏈的一項技術。
如果這是真的,那麼這對開源模型來說是一件大好事,因為比起大型模型,循環深度對小型模型的效能提升更大。
因為循環深度可以讓一部分原本需要靠更大參數量獲得的能力,改為在推理時靠更多計算換回來。代價是更高的推理計算。
更重要的是,循環深度和 MoE 架構存在明顯的結構性協同,天然比 dense Transformer 更適合 MoE 架構。因為 MoE 循環時,每一輪可以呼叫不同專家,因此同一套共享層可以在不同循環裡執行不同計算
之前已經有論文研究發現,透過循環深度技術能讓 35 億的模型跑出 500 億模型的評分
雖然最終無法確認 2 個月之內開源小模型就一定能達到 astra 水平,但在架構上,顯然有更大優勢。接下來 astra 等級的模型能力可能會以比之前前沿模型更快的速度,被開源小模型趕上
所以。。。
顯卡是不是又要再漲價了?