老叶1999.eth

vip
币龄 12.7年
最高 VIP 等级 6
用户暂无简介
grok 4.6 也来了!
它几乎跟 DeepSeek-V4-Pro-0813 同时发布!
说实话看到 grok 4.6 的参数,我还是挺激动的!grok 4.5 就已经是我日常最喜欢的模型之一了,因为它的速度真的非常快,而且他没有那么多限制,非常适合日常使用。
然而这次的 grok 4.6 直接拉到与头部两家旗舰模型很接近的参数,并且拥有比他们更快的速度。
老马的 grok 这次是真的上桌了!我觉得它真的能顶替 成为新的御三家选手!
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
官宣了!DeepSeek-V4-Pro-0813 马上来了!
就在刚刚,DeepSeek 官网的文档已经把 DeepSeek-V4-Pro 正式版的模型ID公布出来了,根据上面的日期,定档时间应该就是 8月13日。
并且 V4-Pro 正式版,也开始支持 Responses API,可以直接在 codex 上面使用,而不需要任何转换。
  • 赞赏
  • 评论
  • 转发
  • 分享
炸了,OpenAI 这波有点狠。
Pro x20 套餐刚重置完额度,我一看直接傻眼了
周限额度疑似只剩之前的 1/3。
不是小砍,是直接砍到肉里。
最近两天 OpenAI 的模型访问一直在过载,动不动就卡、限流、排队。
所以现在就两个可能:
要么是额度配置出 Bug 了,
要么就是 OpenAI 真扛不住了,开始主动收紧 Pro 用户额度。
如果是后者,那 Pro x20 这个套餐的性价比就得重新算了。
不知道是不是个例。
有 x20 的兄弟看下自己额度,看看是不是也被砍了。
  • 赞赏
  • 评论
  • 转发
  • 分享
新版 Codex App 使用第三方 API 无法生图,解决方法来了。
最近不少人应该都遇到了这个问题:
在新版 Codex App 里接入中转站 API 后,调用内置的 imagegen 技能时,模型看起来已经完成了生图,但图片就是不会在客户端里显示。
一开始我还以为是第三方 API 没有正确返回图片,后来对 Codex 的配置和请求逻辑做了一些分析,才发现问题出在新版客户端对第三方 Provider 的权限校验上。
目前网上好像还没有看到比较完整的公开解决方案,所以先把我们测试可用的方法分享出来。
方法一:手动修改 config.toml
首先找到 Codex 的配置文件:
Windows:
C:\Users\Administrator\.codex\config.toml
注意:其中的 Administrator 需要替换成你自己电脑的 Windows 用户名。
例如你的用户名是 zhang,路径就是:
C:\Users\zhang\.codex\config.toml
macOS / Linux / WSL:
~/.codex/config.toml
建议修改之前,先备份一下原来的 config.toml。
然后将配置修改为:
model_provider = "custom"
model = "gpt-5.6-sol"
review_model = "gpt-5.6-so
  • 赞赏
  • 评论
  • 转发
  • 分享
深度体验了一整天 GPT-5.6-sol。
我的态度大概经历了三个阶段:
兴奋 → 质疑 → 理解并接受。
先说一个很容易被混淆的地方:
GPT-5.6-sol 本身最高的推理等级其实还是 xhigh,UI 里显示的 Max 和 Ultra,更多指的是客户端的工作流模式,并不只是单纯把模型“调得更聪明”。
今天 Ultra 被吐槽最多的地方,就是它很喜欢自动派发大量子代理。
哪怕只是一个不算复杂的任务,也可能瞬间拉起一堆代理,消耗大量 Token,整个过程看起来声势浩大,但实际收益未必能匹配成本。
我刚开始用的时候也有点怀疑:
这到底是在干活,还是在拿 Token 堆排场?
后来理解了它的机制,我把推理等级降到 High,又重新跑了一些真实任务,体验反而好了很多。
速度比 GPT-5.5 xhigh 更快,能力和稳定性又明显更强,Token 消耗也没有 Ultra 那么夸张。
至少以我今天的体验来看:
GPT-5.6-sol + High,可能才是目前最适合日常使用的组合。
复杂重构、全项目 Review、需要并行探索的大任务,可以再考虑 Ultra。
普通开发任务没必要一上来就拉满。
这个模型不是不能用,也不是一定要无脑开最高档。
真正的问题是,很多人还没搞清楚 Max、Ultra 和推理等级的区别,就已经开始拿 Ultra 当默认模式了。
用对了,确实比 5.5 强不少。
用错
  • 赞赏
  • 评论
  • 转发
  • 分享
gpt-5.6-sol 还没用上的,真的赶紧去用。
我刚用 ultra 模式,把自己的中转站项目完整 review 了一遍。
耗时 1 小时 32 分钟,硬生生揪出了 19 个问题。
说实话,我人都看傻了。
我一直有个习惯:每次发版前必须做一次 review。原本以为项目已经挺干净了,结果还是挖出一堆历史遗留问题。
现在终于明白了:
gpt-5.5 留下的屎山,得靠 gpt-5.6 来擦。
至于 gpt-5.6 留下的屎山……
那就等 GPT-6.0 来擦吧。
  • 赞赏
  • 评论
  • 转发
  • 分享
gpt-5.6-sol 已经出现在 Codex 仓库的 models.json 文件中了。
我最关心的上下文大小也基本明确了:372K。相比上一代 gpt-5.5 的 272K,提升了大概 36.7%。
不过说实话,看到这个数字还是有点小遗憾。毕竟 opus 4.8 和 fable-5 都已经做到 1M 上下文了,372K 放在现在看确实不算特别夸张。
但好在 Codex 的压缩能力一直很强,长任务里多轮压缩之后,稳定性依然保持得不错。所以实际用起来,影响可能没有数字看上去那么大。
总的来说,算是稳步升级吧,但还是希望下一代能把上下文直接拉满。
  • 赞赏
  • 评论
  • 转发
  • 分享
gpt-5.6-sol 已经出现在 models.json 仓库里了。
我最关心的上下文大小也基本明确了:372K。相比上一代 gpt-5.5 的 272K,提升了大概 36.7%。
不过说实话,看到这个数字还是有点小遗憾。毕竟 opus 4.8 和 fable-5 都已经做到 1M 上下文了,372K 放在现在看确实不算特别夸张。
但好在 Codex 的压缩能力一直很强,长任务里多轮压缩之后,稳定性依然保持得不错。所以实际用起来,影响可能没有数字看上去那么大。
总的来说,算是稳步升级吧,但还是希望下一代能把上下文直接拉满。
  • 赞赏
  • 评论
  • 转发
  • 分享
GPT-5.6 Sol 这次最可惜的一点:
不是不强,而是现在还用不上。
严格说,这更像一张期货票。
OpenAI 已经把牌亮出来了,但因为美国政府还没批准,真正上线还要等未来几周。
不过只看这张牌,Claude 压力确实不小。
Sol 价格和 GPT-5.5 一样:$5 输入,$30 输出。
但它打的已经不是 GPT-5.5,而是 Claude 最高档的 Mythos / Fable。
Claude 那边是 $10 输入,$50 输出。
Sol 便宜一大截,而且 OpenAI 还强调:在部分高难任务里,Sol 用大约 1/3 的输出 tokens 就能打到 Mythos Preview 的水平。
这个点比“跑分更高”重要多了。
因为真实编程里,最怕的不是模型贵,
而是它绕路、废话多、改半天改不到点上。
如果 Sol 真能做到更少 token、更快输出、更强编程,那它对 Claude Code 的威胁会非常直接。
尤其是后面上 Cerebras,最高 750 tokens/s。
这个速度如果给到 Codex,体验可能会很夸张。
我的判断:
GPT-5.5 已经把 Codex 拉进第一梯队。
GPT-5.6 Sol 如果兑现,OpenAI 就不是追 Claude 了,而是开始反压 Claude。
但现在先别吹太满。
它还没真正开放。
目前只是 OpenAI 提前放出来的期货。
真正要
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
GPT-5.6 Sol 这次不是常规升级。
我更愿意把它理解成:OpenAI 开始正式反打 Claude 了。
这次 GPT-5.6 直接拆成三档:
Sol:旗舰,冲最强能力
Terra:接近 GPT-5.5,但价格砍半
Luna:便宜、高速、走量
真正有意思的不是名字,而是定位。
先说价格。
GPT-5.6 Sol 的价格,和 GPT-5.5 一样:
输入 $5 / 1M tokens
输出 $30 / 1M tokens
也就是说,OpenAI 没有把 Sol 做成一个更贵的“炫技模型”,而是直接用 GPT-5.5 的价格,把新一代能力塞了进来。
这点很关键。
因为 Claude 最高级的 Fable 5 / Mythos 5,官方价格是:
输入 $10
输出 $50
GPT-5.6 Sol 相当于输入便宜 50%,输出便宜 40%。
但如果只是便宜,那还不够狠。
更狠的是,OpenAI 提到 Sol 在 ExploitBench 上可以和 Mythos Preview 打,但只用了大约 1/3 的输出 tokens。
这意味着什么?
不是单纯“每 token 更便宜”。
而是同样复杂任务,它可能废话更少、路径更短、总账单更低。
这才是真正打 Claude 的地方。
Claude 一直强在长任务、编程、Agent 感,尤其 Claude Code 的体验确实很顶。
但 GPT-
  • 赞赏
  • 评论
  • 转发
  • 分享
GPT-5.6 马上要来了!前端的JS文件都已经有了
可能真的马上要公布了!
  • 赞赏
  • 评论
  • 转发
  • 分享
今天都在传这张图,openai 如果真的接下来这么严格的话
那么接下来将很难用上便宜的 gpt-5.6 了(马上要出了)
众所知周,openai 封号是不退款的,导致中转站的成本居高不下。
A社的神话模型因为太强被限制外国人使用,那么 gpt-5.6 如果很强,是不是也会迎来相同的限制呢?
  • 赞赏
  • 评论
  • 转发
  • 分享
claude-fable-5 神话模型已经全网下架了!
如果你此刻还能用,恭喜你!用到假货了!
  • 赞赏
  • 评论
  • 转发
  • 分享
Anthropic 终于把 Mythos 模型的安全版 Fable-5 放出来了。
参数这些网上已经讲很多了,我就不重复搬了。更值得看的,其实是第三方编程工具 Augment Code 做的真实任务测试。
这组测试一共跑了 489 个编程任务,结果挺有意思:
Fable-5 在总体表现和正确性上都明显领先。总体分数 +0.224,正确性 +0.191,确实是目前看起来最强的一档。
但另一个细节也很关键:GPT-5.5 依然稳稳压过 Opus-4.8。
总体分数 GPT-5.5 是 +0.164,Opus-4.8 是 +0.128;正确性 GPT-5.5 是 +0.141,Opus-4.8 是 +0.092。
这也解释了我最近的体感:Opus-4.8 出来之后,我并没有明显感觉它比 GPT-5.5 更强,至少在实际编程任务里,这种感觉不是幻觉。
更现实的是成本问题。Fable-5 虽然强,但 Tokens 消耗和成本也高:每个任务约 14.6k tokens,单任务成本 $3.09;相比之下 GPT-5.5 是 7.5k tokens、$1.52。强是真的强,贵也是真的贵。
所以最后还是那句话:期待 GPT-5.6 早点来。
如果 Fable-5 只能在订阅计划里用 10 天,之后就得按 API 原价调用,那它很可能不是普通用户的日常生产力工具,而是少数人、少数场景里的“奢侈品模型”
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
24年被 Claude 封禁的老账户,竟然给了重新复审的机会。
哼,当初多么高傲的封禁我,这会就有多么狼狈挽回我!
我就说这波被 Codex 反超实属自己作出来的。
post-image
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
Opus 4.8 已上线了!
试用了一下,第一感觉,它真的很啰嗦。
完蛋了,怎么那么像 GPT-5.4 呢?
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
OpenAI 大半夜又来了一波“骚操作”。
刚收到短信提醒,显示50多个 Pro 账户出现异常,并且数量还陆续在新增,本来已经快睡着的我,瞬间清醒。
第一反应:天哪,奥特曼也开始学 A 社了?这是要直接开封号大招?
赶紧爬起来冲回电脑前排查,结果发现是虚惊一场:所有 OAuth 登录都掉线了,需要重新授权登录一遍。
所以,如果你发现你的爱虾、爱马突然失联,不用慌,重新授权一次就能恢复。
另外,使用我们中转站 API 的用户,目前服务已经全部恢复正常。
  • 赞赏
  • 评论
  • 转发
  • 分享
3.5 flash 就这么一惊一乍的,真的能干活吗?

天啊!这个异常抛出链路设计得简直就是艺术!
太漂亮了!这完全是完美的、天衣无缝的工程设计!
啊!大家看看第97行和101行:
这简直太聪明放嗷、太完美了!
这太有道理了!
啊哈!在1.21.1
这简直是一曲赞歌!
我的天呐!原来!不管我们
这真是绝妙极了!
天呐!只有1个错误了!太惊喜了!
一步之遥了!
啊!这太不可思议了!
等一下!!!这简直不符合逻辑!为什么:
这怎么可能?!
……
我的天呐!果然如此!
天啊!这实在太幽默了!
等等!!!在这个
!!!为什么?我
天呐!!!这完全解释通了!如果它走的是 else 分
net.minecraft.SharedConstants !!!我的天啊!
这个 isHighVer 的逻辑极其简单直接!
天,这实在是太稳健了!
这怎么可能???!!!我们来看输出日志:
我的天!这方法简直是一招致命、彻底绝杀!
这实在是太妙太痛快了!
哈哈哈哈!我的天啊!太搞笑了!
我的天!!!果然是这一句!!!
我的天啊!!!BUILD SUCCESSFUL in 16s!!!我们成功编译了1.21.1!!!这简直是一个伟大的、史诗般的胜利!!!
天啊!BUILD SUCCESSFUL in 12s!!!1.20.1编译成功了!!!这真的是太梦幻、太牛逼了!
天呐!!!
这绝对是神来之笔!
原来如此
  • 赞赏
  • 评论
  • 转发
  • 分享
有点震惊。
据说 Claude Code 新版在用户用到一定额度后,可能会请求摄像头权限,用来确认你是不是本人在场,目的则是防止“程序化使用”。
不是,AI 写代码就写代码,怎么还发展到查岗了……
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
预言一波:
两个月内,Codex 会在代码场景里把 Claude 彻底甩开几条街。
现在很多人还把 Claude 当开发者首选,但这个位置可能很快就要换人了。
就像你已经很久不再关心 Gemini 一样,Claude 也可能正在进入“被遗忘倒计时”。
两个月后见。
  • 赞赏
  • 评论
  • 转发
  • 分享