runesleo

vip
币龄 8.6年
最高 VIP 等级 6
用户暂无简介
我一直以为 Codex 最近慢得离谱,是 Skill 装太多了。
结果一查日志,完全不是。
其中一步跑了 138.6 分钟,经历 206 次模型/工具往返,光等子 Agent 就花了 54.9 分钟——但这一步一次 Skill 都没加载。
真正拖慢 Agent 的,往往不是模型,也不是 Skill,而是过度编排:
- Ultra 主控下面再堆 full-history 子 Agent
- 多轮「审查 → 修复 → 复审」
- 高频轮询
- 每个小改动都跑全仓测试
我刚把默认工作流改了:
保留 Ultra 主控,但只留一个实现者;非平凡任务最多一次终审;开发期只跑 focused tests;全仓测试放到里程碑末;长任务用事件等待,不再反复轮询。
先用日志找到时间究竟花在哪一层,再砍编排。
别一慢就先删 Skill,也别把「更多 Agent、更多审查」误当成更准确。
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
一个人干活,最难的不是没事做,是早上打开电脑不知道从哪下手。
我后来发现症结在于:把两件完全不同的事挤在同一个时间点做了。
一件是**看世界**——外面发生了什么、有没有跟我相关的变化、哪条值得跟。这件事的性质是筛选,输入来自外部,做完应该是一份「值得看的 0-3 条」。
另一件是**管自己**——我手上有什么在跑、卡在哪、今天推哪一个。这件事的性质是排序,输入全是自己的存量。
混在一起做,结果就是一边刷信息一边焦虑该干活,两件都做不好。
拆开之后顺序也是固定的:**先看世界,再管自己**。反过来会出问题——你按昨天的判断排好了今天,然后才发现外面变了,排的东西已经不该做了。
值得抄的是这个分工,不是任何人的具体流程。你的两件事可能各花五分钟,但它们必须是两件事。
  • 赞赏
  • 评论
  • 转发
  • 分享
你让 AI 帮你处理事情的时候,密码这一关是怎么过的?
我见过三种,风险差得很远:
一、直接把密码贴进对话——最省事,也最糟。那句话会进上下文、进日志、可能进训练数据,而且你撤不回来。
二、让 Agent 去读你的密码管理器——听起来专业,但它拿到的是明文,之后这段上下文去了哪你不知道。
三、Agent 只发起请求,你在密码管理器自己的界面点确认,值直接填进页面。Agent 全程只看到「已授权 / 未授权」,看不到值。
第三种才是能长期用的。判据很简单:**这个方案里,明文有没有经过 AI 的上下文**。经过了就不安全,不管中间包了几层。
还有一条更基础的:需要密码的操作,尽量别让 Agent 代劳,让它把你送到那一步就够了。省下的那点时间,不值得拿账号去换。⚠️
  • 赞赏
  • 评论
  • 转发
  • 分享
超级方便的Ai agent 客户端置顶对话自动替换!现在Ai app 的对话芯片太好用了
对话聊太久聊满了,不用硬撑也不用手动切换
直接让AI 自动开同角色新窗口续聊,
或把新窗口替换成侧栏置顶入口。
一套自动化,三个用法:
1. 在这个对话里指挥它,接替另一个对话当置顶
2. 新开一个窗口继续干分叉/临时任务
3. 派发子任务,但用新窗口去续跑
以 Cursor 为例:
弹窗确认 → 侧栏一点进新入口。
剪贴板已预填 /remote-control,
粘贴一次就能挂手机 Remote Control。
AI 来了,人越来越懒了,能自动化的绝不手动一丁点儿🤏
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
先把 Cloudflare Wallet 的品牌名拿下了:
☁️
目前一个 Cloudflare 账号只能认领一个 handle。想保留品牌名的,可以先去看看:
  • 赞赏
  • 评论
  • 转发
  • 分享
给自己的 AI 试试这个 prompt:
【来跟我讨论一下,十年后我想成为怎样的人。
别只聊抽象愿景,帮我把财富、工作、健康和关系都聊清楚。
以后每周带我复盘:这周做的事,有没有让我离那个方向更近?如果偏了,告诉我下周最该调整的一件事。】
  • 赞赏
  • 评论
  • 转发
  • 分享
很多人把这次改动理解反了:
Polymarket 改的不是起跑线,而是终点判定。
起跑线仍是本轮 Price to Beat;终点则从最后一个瞬时价格,变成最后 30/60 秒的平均价格。
  • 赞赏
  • 评论
  • 转发
  • 分享
一个主战场约 96% 胜率的 Polymarket 玩家:我把 BipBop 的 1632 笔仓位拆开了
排行榜上这个账号:BipBop
1632 笔已结算仓位,主战场胜率约 96%,连续多个月月月为正。
大多数人第一反应是:抄他。
我们真去抄了「看起来像他」的那一层——把「买 0.85–0.95 高概率盘、拿到结算」做成机械策略,回测 5378 个市场(高概率盘对照组):胜率 88.9%,净收益 −2.5%。
胜率是幻觉。高胜率可以是亏钱策略。他赚的,不是你以为的那笔钱。
——
我拆了什么
拉全史公开成交 2414 笔,把 1632 个已结算仓位对上官方结算,再按事件类型 × 入场价格带切矩阵。
已结算合计:成本约 $30.0 万,利润约 +$5.8 万,ROI 约 +19%。
不给可跟单路径。只讲聚合结果,和一套以后也能用来看别人的读法。
——
主结论:利润不在 0.85+
主战场是 mention / say 类事件。
(图 1:胜率幻觉对照)
(图 2:主战场四价格带)
读法只有三句:
1. 别被最高胜率骗。0.85+ 最好看,但不是钱袋。
2. 别被最高 ROI 骗。<0.4 很猛,样本太少,当不了主引擎。
3. 先找绝对利润落点,再解释它为什么成立。
主战场里,0.6–0.85 绝对利润约 +$28.6K;0.85+ 只有约 +$10.9K。笔数更少的中段,反而搬走了大
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
Codex 挂了,恭喜大家马上迎来一波新的额度重置!
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
自动交易现在很热,大家都在教 Claude 直接下单。
但权限不该这么捆在一起。
可拿走的一条规则是:研究权限可以给 Agent,交易权限(钱包、签名、下单)不能一起交。
正确拆法是:只开公共只读研究面,执行面永远单独、人工放行。
polymarket-toolkit 就是这么做的。
GitHub runesleo/polymarket-toolkit 开源后,MCP 提供了 10 个只读工具。
能查 profile、活动、市场扫描、赎回状态这些研究工作。
工具不带 key、不连钱包,也完全不能下单。
npm 上的 polymarket-toolkit-mcp 最新版 0.7.2,规则一致。
先把研究面开放出来,钱包签名和订单执行走另一道人工门。
  • 赞赏
  • 评论
  • 转发
  • 分享
当你不在家里老人身边,而他们又有很具体的需求时,现在有了 AI,真的可以很方便地做出高度定制的小工具。
比如我家里有老人需要做一段时间的肌肉康复训练。我把已经确认过的动作和强度做成了一个专门给他使用的网页:打开就能看到今天练什么,一屏一项直接跟着做。后续计划有调整时,我也能直接帮他们更新页面。
以前这种需求太小、太私人,很难专门做一个软件。现在借助 AI,可以很快把需求变成真正能使用的东西。
AI 在这里不是替代康复师,而是把已经确认过的计划,变成老人和家人真正能够执行的工具。
接下来先实际用一段时间,再看能不能抽象成一个可复用、甚至开源的家庭训练跟练工具。
AI 时代,未来的一切都会是高度定制化的。
post-image
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
天气市场的钱从哪来?
很多小众机会,第一眼都像玩具。
天气市场尤其像。
城市、目标日期、最高温/最低温、温度阈值或区间、是/否合约(YES / NO),等官方结算。
但我自己持续跟了一段时间以后,越来越确定一件事:
这类小众市场真正的 alpha,通常藏在别人懒得结构化的地方。
这里的 alpha,指的是“市场里可能存在的超额收益机会”。
这一期 Leo Insider,我把天气策略拆成四层:
- 市场覆盖差;
- 信息更新差;
- 结算理解差;
- 玩家流差。
最有意思的是第四层。
我把排行榜上长期参与天气市场的公开地址拉出来,当成研究样本,也当成外部确认层:
- 同向,说明候选更值得观察;
- 反向,说明候选需要警惕;
- 无确认,说明它可能只是普通噪音。
完整版会放:
- 天气市场四层 alpha 线索;
- 我怎么搭建候选池;
- 为什么结算源理解很关键;
- 玩家流怎么做外部确认;
- 为什么有 alpha 线索,仍然要卡在放大前;
- 一张“小众策略 alpha 验证表”。
这期真正想讲的是:
一个看起来很窄的市场,怎么从“好像有机会”,变成一套可验证的研究流程。
我主要研究的市场入口:Polymarket
  • 赞赏
  • 评论
  • 转发
  • 分享
很多人装 GitHub 项目前,会先刷一下 Star 数。
Star 只是发现信号。真正决定能不能装的,是安装前的四道门。
拿一个目前只有约 1 个 Star 的仓库做例子:chungty/unjiggle。
命令是 pip install unjiggle。
用 AI + 它,把 iPhone 304 个 App 整理成了 3 页。
第一次写回,系统直接把布局重排了,以为失败;第二次完整读写才真正稳定下来。
走的路径是备份 → safety-test → suggest/go,再人工确认每一步。
装 GitHub 工具前,建议过这四道门:
1. 可执行安装面
安装命令是否一行就能跑通?依赖和步骤是否真正可执行,不用各种折腾?
2. 近期维护
最近还有更新吗?作者是否还在处理 issue 和反馈?
3. 权限
它会申请哪些访问权限?权限范围是否和功能匹配,会不会过度?
4. 可回滚的安全测试
改动前备份了吗?有没有 safety-test 或 suggest 模式先看效果?翻车后能不能干净回滚?
Star 帮你发现,不帮你验收。
把这四条记下来,下次再遇到小众仓库时,就知道该怎么判断了。
  • 赞赏
  • 评论
  • 转发
  • 分享
现在人人都在让 AI 写代码,但我今天干了件更刺激的事——让它写了一段会自动花真钱、完全无人值守下单的代码。
先把决策卡写好,把边界、最坏情况、kill 条件全想清楚才敢动手。本来想让 Codex 自己搭执行器,结果派发通道全天不稳,改成我自己主线程一点点自建。
上线前跑了 7 轮对抗式 code review,硬抠出 26 个 P0 级致命 bug。从那种会连环下错单的进程并发破帽,一轮轮收窄到时钟偏差,最后只剩 14 天才触发的边角老化洞。
部署到 VPS 之后,一个傍晚的真实 canary 又抓到一个白天测全绿、晚上才露面的 bug。
今晚 21:30,首单终于真实放出去了。
说实话,这只是个微额学习实验。单日敞口大概 10u 上下,设了 30u 硬 kill 线。拿小钱换真实数据和踩坑经验,不是来搞规模化盈利的。
现在还没有任何结果,只能说:代码上线了,今晚等着验证。
AI 写这种会花钱的系统,审查这道坎到底能扛到哪?
post-image
  • 赞赏
  • 1
  • 转发
  • 分享
scarletxanin:
非常感谢这份内容
X 上那些看起来最夸张的截图和数字,反而是 AI 时代最容易验证的东西。
把原帖和截图交给 AI 深入分析一下,数字口径、证据缺口和前后矛盾,很快就会浮出来。
哪些靠谱,哪些不靠谱,已经没有以前那么难查了。
  • 赞赏
  • 评论
  • 转发
  • 分享
最近我把多模型路由重新梳理了一遍,加上显式降级回执和人工动作 gate。目标是让系统在模型出问题的时候还能保持可控。
Hugging Face 2026-07-16 官方披露攻击日志超过 17,000 条记录那天,我却发现自托管分析路线在事故当天到底能不能用,根本没检查过。
Hugging Face 团队先用商业 API 的前沿模型来处理这些日志。结果真实攻击命令、漏洞利用载荷和 C2 产物都被安全护栏挡住了。
之后他们切换到自有基础设施上,跑开放权重的 GLM 5.2 才把取证完成。攻击者数据和日志涉及的凭据没有离开环境。
这不是在说要取消安全护栏。护栏继续发挥作用,防守方仍需要一条能在自家环境里走的分析路径。
自托管 forensic canary 目前还没跑通,我只是在准备新增这条能力。
下一步准备做的是:在事故发生前,用安全的惰性样例先把自托管分析路线验证一遍。分析完成,不等于就能获得执行动作的权限。动作始终要继续走人工 gate。
真正有准备的系统,不是事后才发现哪条路走不通,而是在需要它之前就确认每一条都能用。只有提前测过,才能在关键时刻顶上。
  • 赞赏
  • 评论
  • 转发
  • 分享
五天前我把 Claude、Codex、Cursor、Grok 四条 lane 全锁到最强模型加最高推理档。想法是既然付了钱,就该把最好的用满。
五天后发现根本扛不住。额度掉得太快,最强模型拿去干重复的检查和格式工作,纯属浪费。
现在改了,按判断密度来分。出错会亏钱或污染数据的审查、交叉验证、资金策略这些任务,继续保留最强席位。日常实现和开发走中档模型。机械活和摘要,能写脚本的就先写脚本。
模型分配只看判断密度,不看订阅价格。
你们是怎么挑不同任务给不同模型的?
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
很多人看到现实事件已经结束,市场标题写得一清二楚,甚至价格显示接近 0 或 1,就以为 Polymarket 这个市场已经最终结算了。
这些信号本身,其实不能证明市场已经最终敲定。标题只是问题描述,显示价格也只是当前市场的一种价格反映。
我的判断门只留一句:先过这六问。任何一项说不清,就跳过这个市场。
1. Rules 到底问什么。
标题只描述问题,Rules 才决定如何结算。官方明确 Rules 规定 resolution source、end date 与 edge cases。很多人只看标题就觉得结果已经确定,其实 Rules 里可能还有需要额外确认的边界条件。
2. 指定 resolution source 是什么。
市场会明确写出用哪个来源来判定最终结果。只能用这个指定的来源,不能拿其他新闻报道、社交媒体帖文或者第三方总结来替代。即使其他地方已经到处说结果出来了,也要确认指定源有没有正式输出。
3. 截止时间、时区和结束条件是什么。
End date 只是市场具备提出结算资格的时间点,不等于已经最终结算。具体截止、时区和结束条件以该市场 Rules 为准。最终状态还要看后续的 proposal、challenge 和 finalization 流程。
4. 取消、延迟、平局、数据修订等例外怎么处理。
Rules 里通常会提前写明这些情况的处理方式。Clarificatio
  • 赞赏
  • 评论
  • 转发
  • 分享