廣場
關注
熱門
新聞
我的主頁

jolestar

vip
幣齡 8.7年
最高等級 5
用戶暫無簡介
0
關注
7
粉絲
40
按讚
假期帶孩子自駕遊,適合一家四口的飯店太難找,大多都是兩大一小的房間。發現只有電競飯店有四人房,於是試住了一晚,帶兩個孩子玩了一晚上魔獸爭霸冰封王座。一排電腦桌,兩張上下舖,恍惚間似乎回到了大學時候。
感覺 deepseek 也不便宜啊,我主力是 gpt 20x 和 glm 20x,deepseek-flash 主要做備援。難道是這兩個傢伙經常服務超載,所以最後 deepseek 默默承擔了?😅
DEEPSEEK-1.23%
GLM+4.45%
看到 Ayman Nadeem 的文章《Plan Mode Is Dead》。但我個人還是習慣讓 Agent 生成一份計畫文件,我先看看,不一定是 Plan mode。
因為同一個問題有多種解法,我需要看它的方案選型,還要看它怎麼實現功能切換,怎麼處理相容性,怎麼分步驟實施。
記得有一次就是因為我沒仔細看方案,Agent 給我搞了一套巨複雜的漸進式開關升級策略,開關還不是靜態的,是運行中動態管理的,於是後面修了好幾天開關的 bug。
這還是那個 human 什麼時候介入 Agent loop 的問題。如果不提前介入,那就只能事後補救。是否可以完全不介入?至少現在還不可以,因為如果完全不介入,你就完全不清楚當前產品的狀態,連對產品進行思考都無法進行了,只是介入的深度差異的問題了。
post-image
MODE-5.69%
Holon(@holonrun) 源於我自己日常使用 AI Agent 時的幾個真實痛點,從一個滿足自用的小玩具,變成了我每天都在用的主力系統。但它離成熟的通用工具還有不少距離。
如果你對這種長駐、異步、由工作項驅動的 Agent 感興趣,非常歡迎體驗並給我回饋。
給 Agent 調度系統加一個小決策模型
測了一下 Jev,又把我前段時間想給 @holonrun 做的語義調度系統撿了起來。
當時重構 Holon 的調度系統,目標是讓 Agent 可以像人一樣,在多個工作項之間切換:一個工作項需要等待外部流程時,就先切到另一個工作項繼續執行。
但遇到了一些難題,Agent 收到一個輸入後,系統很難只靠靜態規則判斷:
* 這個 GitHub event 應該插入當前 turn,還是進入佇列?
* 它和哪個工作項有關?
* Agent 處於 sleep 狀態時,是否應該被喚醒?
* 一個已經過期的後台任務結果,是否可以直接丟棄?
這些問題本質上不是普通的狀態機判斷,而是語義判斷。每次都調用一次 LLM,成本和延遲又太高。當時我想自己訓練一個分類器來處理這些判斷,但訓練結果不太理想,模型有點保守,為了避免出錯不下結論。也可能是我自己的數據量太小,於是最後作罷,只留了一個 hook,沒有真正實現。
Jev 這種專門做小決策的模型,剛好適合放在這裡。昨天試了一下,效果比預期好,所以我準備重新啟動這個方案,再測試觀察一段時間,後面再出個詳細的報告給大家。
我感覺各大廠很快會跟進這種方案,估計各家都會帶一個專門的 Decision Model,用來處理這類場景。
Agent 寫了個腳本,在後台啟動。結果在 while 迴圈裡忘記增加游標,弄出了死迴圈,輸出把磁碟塞滿,然後把自己弄掛了😅。這種情況似乎在 harness 裡也不太好防。
郭德綱改紅歌被罰款事件的一個副作用是很多音樂服務都在下架紅歌,誰能保證自己的版本是沒改過的呢?😅
暑假裡給兩個娃電腦上都裝了 Coding agent,我觀察他們怎麼玩。
哥哥有 Scratch 程式設計經驗,有自己的想法,做過一些有創意的 Scratch 遊戲。他玩了幾次後就放棄讓 AI 直接生成應用程式了,主要理由是 AI 生成的不是他想要的,他腦子裡的想法給 AI 也說不清楚。還有,他感覺 AI 做的東西不是自己做的,找不到創作的感覺。
他最後的做法是讓 AI 修改他的 Scratch 檔案。Scratch 是拖曳式程式設計,檔案格式不是為純文字編輯而設計的,AI 改起來很吃力。但他玩得也自得其樂,還讓 AI 幫他做 Scratch 多人連線。我說 Scratch 已經限制了他的發揮空間,但他還是覺得生成的東西自己能看懂會更有掌控感。
弟弟還沒有形成那麼明確的創作目標,更容易接受 AI 給出的結果,生成什麼玩什麼,但又很難定義他在學程式設計。
AI 時代還需要學程式設計嗎?如果要學,學的到底是什麼?哥哥要的是掌控和創造的感覺,弟弟享受的是結果本身——哪一種才算"在學程式設計",我也一直在思考這個問題,下次單獨寫寫。
用多了 AI 後發現自己不太愛說話,包括網路上,好久沒發過推文了。
以前古法寫程式,程式碼寫多了會覺得憋得慌,於是會寫寫文章,在群裡閒聊。但用了 AI 後,寫程式就是閒聊了,輸出的配額似乎被用完了,沒有輸出的慾望了。
和人聊天也沒有了耐心,剛聊兩句,我就想說:「你還是去和 AI 聊一下吧」,或者「我還是去和 AI 聊一下吧」。
但這樣久了感覺也不對,尤其是在家寫程式,整天也沒人交流,網路上不活躍就和隱居似的。接下來要逼迫自己活躍一下,或者組織一些線下的交流活動了。
模型用 rg 老出錯,錯誤率大約 10%,問題出在 rg 對 -rn 的處理和 grep 不一致,模型更熟悉 grep,於是老用錯。AI 時代,新工具替代舊工具,應該無縫接受舊工具的所有輸入,尤其 LLM 熟悉的工具。
post-image
GPT 的訂閱莫名其妙被 Google play 取消了,現在 android 版本的 GPT 上似乎麼有訂閱入口了?有人遇到類似的問題嗎?
holon v0.19.0 發布了
這個版本 內置了一套 web UI,同時也把底層存儲系統重構了一遍,api 和 event 系統重構了一遍,填了許多 AI 挖的坑。
原來用的是 JSONL,數據量大了後就很難維護。疊加上 AI 編程習慣是 grep 然後發現沒有就加,導致有很多 api 和 event 冗餘。
於是全弄到 sqlite 數據庫中了,結果沒想到積累到數據已經很大了,數據庫超過了 4G,遇到了性能問題,於是繼續優化,現在這個版本算穩定了。
歡迎大家嘗試,Web UI 略微簡陋,但 holon 的模式是同一套接口,支持 tui 和 web ui,看到的 agent 的視圖是一致的。
codex 裝置令牌登錄突然要驗證手機號碼了?而且發現 openai 的手機號碼在帳戶設定裡找不到呀?改都似乎沒地方改。
Agent 需要什麼樣的基礎工具集
看到大家在聊 Agent 工具集的問題——是不是提供一個 shell 就都搞定了?做了 holon 之後發現,其實沒有那麼簡單。
讀:為什麼放棄了 Read/Glob,全走 shell
holon 的工具集改了幾個版本,最後廢棄了類似 Claude Code 提供的 Read(讀檔案)、Glob(模式搜尋)這類專用工具,讀取和查找全部通過 shell 來完成。這和 Codex 的路線一致——Codex 的 ExecCommand 一把梭,讀檔就是 cat,搜程式碼就是 rg,不再單獨為每種"讀"操作定義一個工具。
這樣做的理由很樸素:shell 是 LLM 最熟悉的"程式語言"。與其讓模型去學你定義的 Read 工具的參數語義,不如直接讓它寫已經訓練了數十億次的 shell 命令。每多一個專用工具,模型的認知負擔就加一層;而 shell 這個界面,模型已經足夠熟練了。
但全走 shell 有一個代價:輸出截斷。框架為了避免 shell 返回值太長撐爆上下文,會給每個命令設輸出上限。Agent 用 cat 讀一個大檔案,可能只拿到前半截,剩下的在 artifact 檔案裡,還得再 cat 一次甚至多次才能讀完。Claude Code 的 Read 工具壓縮閾值比通用 shell 高很多,讀大檔一步到位,少了好幾個來回。本質上是取
給 Codex 計劃分配一個里程碑,然後一直往裡面塞 issue,它就一直在工作。可惜我塞的速度趕不上它實現的速度😅
和 gpt 交流多了后,自己也习惯用“收口”这个词了。一些任务完成后,但还有一些零碎的事情没搞,告诉它把剩下的事情收口,感觉很自然。我都忘了不用收口这个词之前是咋表达的😅。
這種詞彙是怎麼串進去的呢?雖然 gpt 5.5 已經夠厲害了,但出現這種問題總讓人對它的可靠性產生懷疑😅
Codex Plus 的每週限制快到了,多窗口長期不關閉導致 iTerm 占了幾十G內存,磁碟也被 Agent 搞的 worktree 弄滿了,一直彈出清理窗口。於是被迫重啟一下電腦,開了個 Codex 讓用餘量清理一下磁碟,打算給自己放個假休息。結果發現 Codex reset limit 了!!😅
post-image