广场
最新
热门
资讯
我的主页
发布
Sleepy0x13
币龄 5.2年
最高 VIP 等级 0
关注
用户暂无简介
0
关注
1
粉丝
22
点赞
广场
直播
Sleepy0x13
21小时前
终于出分了!25周年金皮金球练号10分!
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-21 01:57
很长时间一直都在找一个有这个功能的Agent产品:
- 能把我的任务/需求拆解成不同的子任务
- 然后根据我配了哪些模型的api,把子任务分配给最合适/最便宜/性价比最高的模型
不然每次都我自己来判断选择还是很麻烦的,猪脑痛
有产品现在能解决这个需求吗?
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-19 11:12
周四有没有在香港的饭搭子
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-18 05:21
我自己的使用体验是,距离 Agent 真正替代人的工作,其实还有非常非常远的距离。
现在的 Agent,比较擅长完成一件工作的 1 到 60 分:搜集资料、整理信息、批量执行、生成初稿,这些事情已经能做得很快。
但一件工作最难的地方,往往恰好在两头。
从 0 到 1,需要人知道问题到底是什么;从 60 到 80,甚至最后做到 100,需要人判断什么是对的、什么是好的,以及哪里还差那么一点。
这两件事,目前都很难单纯依靠模型能力的提升解决。至少在办公场景里,我越来越觉得,Agent 面临的问题已经不只是「模型够不够聪明」。
它和我们过去接触过的任何一种办公软件,都有一个很明显的区别。
以前的软件追求的是开箱即用。Excel、Photoshop、Notion,功能可能很复杂,但产品交到用户手上的那一刻,它基本已经是一个完整的工具。
Agent 不一样。
一个真正好用的 Agent,很可能是被一个人、一家公司,甚至一个具体岗位长期养出来的。
它需要知道你平时怎么工作,知道公司的内部流程,知道什么事情应该找谁,知道哪些资料可信,甚至要逐渐理解一些从来没有被写进 SOP 里的潜规则。
所以 Agent 越往真实工作里走,越不像一个标准化软件,反而越像一个需要不断磨合、不断调教的新同事。
这也是我觉得 Agent 普及最大的障碍之一:它很难真正做到开箱即用。
背后还有另一个更麻烦的问题是数据。
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-09 16:53
舒服了舒服了舒服了舒服了舒服了舒服了
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-09 02:35
哈萨比斯原本想和Jeff Dean同时离开谷歌
好家伙
Pathfounders 援引行业消息人士称,哈萨比斯原本想和 Jeff Dean 同期离开谷歌,但管理层担心两位 AI 大佬一起出走会重创股价,因此劝他先留下。
最终 Jeff Dean 等人离职,哈萨比斯则转任 Google DeepMind 董事长和 Alphabet 首席科学家。消息公布后,
$GOOG
股价一度跌约 5%。
这样看来哈萨比斯的走也是早晚的事了,谷歌 AI 看来没救了。
GOOG
1.04%
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-09 02:24
美国防中国机器人,硅谷直接去深圳人肉背货
刚看到《The Information》这篇报道,这个画面也太魔幻了。
今年4月,一个旧金山投资人带着一长串采购清单飞到深圳,直接把机器人和零部件塞进行李箱,坐飞机背回美国。有团队甚至直接买宇树机器人,拆成零件,运回去再自己重新组装。
7月底,美国刚以国家安全为理由,限制新型号外国人形机器人、机器狗进入美国,矛头基本就是冲着中国来的。
美国政府:我们要防中国机器人。
美国机器人创业者:好的,先让我去深圳买点胳膊腿。
😂
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-05 07:05
云厂商会让大模型降智
又看到个有意思的。
模型评测机构 Artificial Analysis 最近做了一项测试:把官方部署的模型成绩记为 100%,再测试不同云服务商提供的同款模型 API。
结果很夸张。
GLM-5.2 最差的一个 API 端点,能力只剩 52%。gpt-oss-120b 在 70% 到 101% 之间波动。DeepSeek V4 Pro 相对稳定,9 家服务商都在 97% 到 107% 之间。
原因主要是云厂商要控制成本。
开源模型运行起来很贵,为了节省显存、提高并发,一些平台会对模型做量化,把原本高精度的参数压成低精度。模型变便宜了,数学、代码和复杂推理能力也可能一起缩水。
有的平台还会限制推理长度和输出长度。
聊天模板、上下文处理和工具调用,也都由云厂商负责。任何一层没调好,都会让模型继续降智。
1人点赞了这条动态
赞赏
1
评论
转发
分享
Sleepy0x13
08-05 07:02
中国开源赢了
白宫在 8 月 4 日的闭门会议上告诉 OpenAI、谷歌、Anthropic 等公司,开放权重模型不会纳入新的 AI 安全审查框架。
Kimi K3、DeepSeek 等中国模型,因此无需在发布前交给美国政府测试。至少现阶段,美国不会借这套框架封禁它们。
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-05 04:32
电脑病毒会自己用AI了,人类一败涂地
还记得小时候被熊猫烧香和木马统治的恐惧吗?
最近有研究团队做了一种接入大模型的电脑病毒,会自己扫描网络、寻找漏洞,再根据不同机器的情况临时生成攻击方法。一次没成功,还会自己复盘然后再次尝试。
攻下一台电脑后,它会把自己复制过去,继续感染其他设备。如果碰到带 GPU 的机器,还能直接调用显卡运行模型,给整个病毒网络提供脑子。
研究人员把它放进一个封闭的 33 台设备网络里测试。多轮实验中,它平均能感染二十多台设备,最远传播到第七代。有几次,它甚至自己设置了定时任务和系统服务,进程被关掉后还能重新启动。
人类灭绝在即。
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-05 03:05
DeepSeek重启500亿元融资,投前估值5000亿
太好了,语录事件之后突然暂停的融资再次启动了。
《财经》援引多名交易人士称,DeepSeek 已重启第二轮融资。公司计划再募 500 亿元,投前估值约 5000 亿元,目标在 8 月下旬完成签约。DeepSeek 尚未回应。
本轮融资至少在 7 月中旬启动,7 月底一度暂停。重启后,DeepSeek 和投资人希望低调推进。部分机构仍未收到恢复通知,交易尚未全面重开。
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-04 01:19
长鑫又要建一座厂,美光盘中跌了4.5%
早上看到一条挺提气的消息。
长鑫存储考虑在北京亦庄建设第二座12英寸DRAM晶圆厂,目前正在和当地政府平台、国资企业谈融资。长鑫现在有三座DRAM厂,合肥两座、北京一座,每座月产能大约10万片。算上上海、合肥和北京的新项目,全部投产后,月产能可能超过60万片,接近现在的两倍。
消息出来后,美光盘中一度跌了4.5%。
现在长鑫只是传出要多建一座厂,美光的投资者已经开始算,三年后的DRAM价格会不会被打下来。
存储芯片是一门极其残酷的生意,技术、良率、资本开支、产能利用率,哪一项掉链子,都可能在周期底部直接出局。过去很长时间,三星、SK海力士和美光三家公司拿走了全球接近90%的DRAM市场。想在这个丛林里面抢肉吃,只能一座厂一座厂地建。
长鑫现在最值得肯定的地方,是它已经从一个国产替代项目,变成了全球存储市场里必须被计算的供给变量。
当然,差距还在。长鑫的DDR5良率、先进制程和HBM能力,距离三星、SK海力士、美光仍有路要赶。可追赶最怕规模起不来。产能上不去,研发没有摊销,客户不敢下大单,供应链也无法跟着成熟。
长鑫现在做的,就是先把这个循环转起来。
内存这种生意,晶圆厂就是话语权。产线建在那里,未来的市场份额才有地方落脚。
DRAM
0.75%
SK海力士
2.30%
SKHY
0.25%
SKHYNIX
0.89%
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-03 11:55
刚刷到了这个玩意儿,叫 Threehalves,是美国机器人公司 Satyress 做的一台灾害救援机器人。
官方给它安排的工作是进山火、废墟、有毒工厂这些人类不方便靠近的地方,搬东西、清障碍、开设备。它目前主要靠人远程操控。
谁会信这玩意儿是来救人的??
两米左右的黑色躯干,四条细长的机械腿,上半身是人,脑袋是一颗没有表情的山羊头,眼睛还是两个小白点。再往手臂上装一把电锯,像森林邪教刚完成了机械飞升。
设计师说设计成这样是因为四条腿比双足更稳,遇到碎石、泥地、斜坡时不容易一碰就倒;人形上半身方便够到门把手、阀门和操作台;手腕也没有做拟人的手指,直接改成工具接口,电锯、钻头、夹具,需要什么就往上装什么。
想象一下受灾群众隔着浓烟看到它从树林里走出来该有多恐慌无助…
赞赏
点赞
评论
转发
分享
Sleepy0x13
08-03 07:51
Qwen3.8 Max比DeepSeek V4 Flash贵20倍
阿里发布了 Qwen3.8-Max 正式版。这是一款 2.4T 参数的多模态旗舰模型,主打编程 Agent、专业办公和长任务,API 已经上线。
Qwen3.8-Max 可能是一款好模型,但从价格来看,它比 DeepSeek V4 Flash 足足贵了20倍。
在 TerminalBench 2.1、DeepSWE 1.1、NL2Repo 和 Toolathlon Verified 四项测试里,Qwen3.8-Max 比 DeepSeek-V4-Flash 高 1.7 到 3.9 分,这点性能差距是绝对撑不起接近 20 倍的价格的。
当然了模型定价当然不能只看 Benchmark。稳定性、并发、服务质量、工具生态都值钱。但这些东西再值钱,也很难值到 20 倍。尤其是 Agent 和长任务,本来就是 Token 消耗重灾区,调用链一长、重试一多,价格差距会指数级放大。
梁圣就是梁圣,感谢 DeepSeek 让我不可能再认同「贵有贵的道理」这句话。
阿里需要证明 Qwen3.8-Max 到底在哪些真实任务里能创造出 20 倍的额外价值。证明不了,这个价格就不成立。
Qwen3.8-Max 权重下周就会开放,Qwen3.8-27B 也将同步开源。官方 API 定得这么贵,最后起到的效果,可能是鼓励
赞赏
点赞
评论
转发
分享
Sleepy0x13
07-29 08:37
本来看《痴迷》之后心理不适了好几天
看到同事的吐槽直接豁达了
赞赏
点赞
评论
转发
分享
Sleepy0x13
07-28 04:45
前天写了deepseek,昨天写了kimi,两篇文章全部喜提被删
现在国产大模型是都说不得吗,而且也他妈的没说坏话啊,夸也不让说吗
DEEPSEEK
0.01%
赞赏
点赞
评论
转发
分享
Sleepy0x13
07-25 16:11
梁文锋因对闭门会内容外泄不满,叫停 DeepSeek 第二轮融资
这下好了,让那些卖 SPV 的 bro 们咋办啊
DEEPSEEK
0.01%
赞赏
点赞
评论
转发
分享
Sleepy0x13
07-24 01:46
地铁广告终于从丑陋刺眼的AI生成的世界杯主题能量饮料换成了刘昊然
赞赏
点赞
评论
转发
分享
热门话题
查看更多
#
BTC突破$77000
4.39 亿 热度
#
Gate首发上线日股交易
397.39 万 热度
#
GateBTC现货交易全网第二
1.58 亿 热度
#
ETH突破2400美元
1.9 亿 热度
#
Gate股票观点挑战
368.43 万 热度
置顶
网站地图