torygreen

vip
币龄 2.9年
最高 VIP 等级 0
用户暂无简介
现在在你自己的硬件上运行 DeepSeek V4 Flash 0731 真的已经成为现实了,但它要花多少钱以及值不值,取决于你是谁。
真正运行它的机器是:
> 256GB M3 Ultra Mac Studio(~$7-9k):容纳 4-bit 构建,并留有余量,单盒整洁。
> 512GB M3 Ultra(~$10k+,如果你能找到一台):能很舒适地运行接近无损的版本。
> 2x H200 或 4x A100 服务器:在 1M 上下文下实现完整检查点,但现在你已经有点在往数据中心的钱包里走了。
它技术上也能在 128GB 上跑,但只能用重度 3-bit 压缩,这会损伤画质。
所以,大约 $7-10k 能搞定一个认真对待的单盒方案,小团队可以直接自有。
说实话,轻度使用时用 API 更便宜。DeepSeek 的托管价格低到只要是一台 $9k 盒,只有在超大、持续的用量下才划算。每月只跑少量 M tokens 的话,API 仍然更好。
但自建的理由不在成本,而在 API 给不了你的所有东西。你的数据永远不会离开机房。无论你怎么推,都是平坦、可预测的支出。没有速率限制,不会出现模型被你抛弃;也不会把敏感代码发送到归另一个国家司法管辖的服务器上。
对于律所、医院、银行,任何无法把数据发给外部 API 的机构来说,这就是全部的胜负手。接近前沿的智能,而
DEEPSEEK-5.67%
查看原文
post-image
  • 赞赏
  • 1
  • 转发
  • 分享
GateUser-3e640a4c:
这是国产那个deepseek吗
芯片供应商。基础设施贷款方。对其自身客户进行股权投资。如今,Nvidia 同时兼具这三重身份,而这个月,戴着这三顶帽子所带来的账单达到了 $750B
,用于 $250B 作为对冲方,回填 OpenAI 位于俄亥俄州的租赁。
> $500B 与 SK 集团在内存方面纠缠在一起。
> $5B 投入 SSI,这是一家没有产品的公司。
> $1B 投入 Naver。持有 Nebius 的股份。芯片流向得克萨斯州它租给自己的设施。
Nvidia 实质上创建的这个循环是:为客户提供资金 -> 客户购买 Nvidia 芯片 -> Nvidia 记入收入 -> Nvidia 为下一个客户提供资金。对它们而言,供需正在向同一张资产负债表坍缩。
这是一家公司在整个 AI 技术栈中同时以供应商、贷款方和投资者的角色运作。
那些以为生的人在给定价默认风险之前就注意到了这一点。5 年期 CDS 创下 82bps 的纪录,这是自该合约开始交易以来最大的单日波动。
而紧张主要在于,集中化模式已经变得如此资本密集,以至于现在必须制造自身的需求来维持扩张规模。当算力充裕且价格便宜时,你不需要为自己的客户承销。只有在维持飞轮运转的唯一方式就是成为整个市场的最后贷款方时,你才会这么做。
世界上相当大一部分 GPU 已经处于未被充分使用的状态,因为没有人把它们协调成真正的供给,而
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
所以我们现在已经跨过了全球数据中心资本开支约 $1T ,正朝着到 2030 年 17000亿亿美元的规模迈进。相较于 2024 年的 $455B 。
这在六年内几乎达到 4 倍。四家美国超大型云服务商在这段时间里大致翻倍。其他所有人,包括新云服务商、AI 实验室、主权项目,才是真正让曲线发生弯折的因素,它们平均每年约增长 39%。到 2030 年,亚马逊、谷歌、Meta 和微软所占的份额也只大约是其中的一半。
两年前,建设基本就是四家公司在做。现在则是一个完整的行业领域,而且新资金流向的是出租计算资源的那一层,而不是囤积计算资源。
$1T 标记也比德尔奥罗的预期更早到来,所以如果 17000亿亿美元的估计也被打破,我也不会感到意外。这里的每一次预测都会遇到同一件事:需求出现得比模型预测得更快,数字会被上调,而不是下调
AMZN4.22%
META5.97%
MSFT5.17%
查看原文
  • 赞赏
  • 评论
  • 转发
  • 分享
2026 年并不是封闭实验室所计划“关闭”的那一年,而一个能够为封闭前沿模型收费的空间现在大约只有三点宽了,K3 刚好来自 @Kimi_Moonshot
K3 刚刚在能力上干净利落地超过了 Opus 4.8,并且每项任务的价格只有一半,同时权重将在几天内公开。只有 Fable 5 和 GPT-5.6 Sol 仍然高于它。
这条线以下的一切现在都是开放地带,任何人都可以在硬件成本下提供服务,不再有 R&D 利润空间来回收。
这是每一次封闭发布的全新算法。只要落在开放前沿之上,你就能为中间的差距定价。落在或低于它,你收取的就是对市场以成本价即可获得的东西加上的利润率。第二名过去曾是 AI 领域的一门生意,但现在它只是一个免费的下载。
而“条带”还在继续变窄。去年的开放模型落后约六到八个月。K3 把差距缩到了大约一代之内,Qwen、GLM、DeepSeek 和 MiniMax 都在它后面排队。
封闭实验室不再只是彼此竞逐“最高点”。它们正在以极快的速度竞逐正从脚下升起的“地板”。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
.@nvidia 正在把 170,000 台 GPU 放到印尼的一座岛上。该园区在 2 周前宣布,并计划在 2027 年第一季度上线——这个时间表在美国当下几乎不可能实现。
GPU 并不是卡点,英伟达正在按营收分成的模式发放其中 170,000 台。真正稀缺的是:在一个关键、时间上说得过去的节点里,把它们接入到哪里。
美国的互联互通排队流程在许多地区要 5 年以上。装在用户现场(behind-the-meter)的燃气轮机会需要 18 个月。这个时间差现在已经成了整个选址博弈的核心。
而且,美国这边的阻力还在不断增加。仅在 Q1,约有 $130B 的产能就被阻塞或推迟了。弗吉尼亚——全球最大的数据中心市场——刚刚又新增了 0.011 美元/千瓦时的电力税;按 1 GW 的园区计算,就相当于 $100M 年。
选址过去是一项房地产决策。现在则是一项电力采购决策,而最快的答案正在转向海外。
NVDA3.71%
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
AI 热潮的首个“牺牲品”也许不是工作岗位,而是所有人的电费,并且工厂正最先遭殃。
> Belden Brick,俄亥俄州:每月产能费用从 $1,600 上涨到 $12,000。现在它在给自己的发电厂定价,以摆脱并网。
> Plaskolite,一家塑料制造商,从 $200K 到每年 $1.2M。
> 宾夕法尼亚州:工业用电在十二个月内上涨 31%。
> 俄亥俄州:上涨 26%。全国平均:7%。
在这一切的上游:PJM 的产能价格在两次拍卖中从 $28.92 -> $329.17,单位为每兆瓦日 => 11 倍。
电网自身的市场监测员表示,数据中心推动了 63% 的飙升,单年达 93 亿美元,并被计费给了其他所有人。
没有人投票决定把美国的电力重新分配给推理(inference)。产能拍卖自动完成了这件事,而且它分不清工厂还是数据中心。它只会向出价最高者成交。
查看原文
  • 赞赏
  • 评论
  • 转发
  • 分享
$130B 在数据中心项目方面于第一季度被阻止或延迟。这与今年仅一个季度就覆盖了 2025 年的全部情况相吻合。
75 个项目。在三个月内,反对团体的数量从 396 增至 833,覆盖 49 个州。该年度前六周内提交了 300 多项法案,14 个州提出了暂停动议,而纽约州立法机构刚刚通过了一项为期一年的暂停,针对任何超过 20MW 的项目。Gallup 调查显示,71% 的美国人反对在家附近建设数据中心,较大约半年前的约一半有所上升。
与此同时,超大规模云服务商仅在今年就计划在资本开支上花费 $690B ,仿佛这一切都没发生。
真正让这件事具有结构性、而非周期性的原因在于:反对行动现在会在项目甚至尚未提交之前就已动员起来。关于数据中心的传闻就足以触发有组织的抵抗。行业的全部供应预测都假设许可只是走形式,但它很快正在变成一个巨大的瓶颈
电力本来应该是制约因素。结果发现,真正的制约是分区规划会议。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
目前人工智能领域最值钱的地产,是肯塔基州一座已停产的铝冶炼厂。
@AnthropicAI与TeraWulf的霍斯维尔园区签署了一份为期20年、价值190亿美元、供电401兆瓦的租约。该园区曾是冶炼厂,拥有约480兆瓦的既有电网接入能力。TeraWulf去年营收大约$1B ;而这一份合同的价值,几乎相当于其二十年的营收总和。
核心资产在于电力接入。你可以生产更多芯片,但你无法在一夜之间创造出兆瓦级的电力。
每一个手里握着闲置电力的比特币矿工,正在变身AI房东:
> Hut 8与Anthropic签订了一份为期15年、价值70亿美元的协议
> IREN正在推进一个价值数十亿美元的园区项目
> Core Scientific、Cipher和Riot都在执行同样的转向策略
如今,Anthropic正在把多吉瓦级的电力承诺拼接起来,并在那些要到2028年才会全面投入运营的站点上签下15至20年的长期义务。
他们从未实现过盈利。他们先锁定电网,然后押注商业模式会随之赶上。
BTC0.98%
HUT4.83%
IREN8.66%
CORZ10.89%
RIOT7.25%
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
AI投资正以46%的速度超出AI收入。2001年电信泡沫期间,这一差距为32%。我们已经超过了电信泡沫的区间,并且仍在加速,预计到2027年年度资本支出将达到$1T 。
代币价格则揭示了另一面。硅数据LLM代币支出指数在5月份达到了每百万代币2.06美元的峰值。现在为1.62美元。六周内下跌20%。自2023年以来下跌超过90%。
代币总支出同比大约翻了一番。更便宜的代币在扩大市场,而非摧毁它。问题在于当价格下跌时,资本支出账单不会缩水。无论你每百万代币收费2美元还是0.50美元,基础设施成本都一样。
训练是一种具有有限时间线的资本支出。推理则是持续性的。当代币价格压缩90%时,服务模型的利润率也随之压缩。客户群在增长,但单位经济效应在变薄。
超大规模计算定价是为一个GPU容量稀缺、买家无处可去世界而构建的。容量仍然稀缺。但为此支付高额溢价的意愿正在减弱。
TOKEN-2.68%
查看原文
  • 赞赏
  • 评论
  • 转发
  • 分享
.@nvidia 不再仅仅参与芯片制造。它正将自己定位为AI基础设施经济中的直接参与者。
从最近的公告来看,他们正在为数据中心提供融资,并从中获取其所产生的云收入份额。
最近的两项合作完美地说明了这一转变:
21万块GPU,对应6年内承诺的250-300亿美元采购量
> Sharon AI $SHAZ 在澳大利亚部署4万块GB300
> Firmus 在巴淡岛将加速器规模扩大到17万块,总功率360MW
与此同时,英伟达及其合作伙伴推出了XFRA液冷GPU系统,用于分布式部署,即使是小规模。一个100单元的试验正在进行中,声称成本比超大规模低5倍,构建速度快6倍。
这一转变具有战略意义。英伟达正从销售硬件转向获取这些GPU在生产中所赚取的一部分。它现在覆盖了芯片、系统设计、软件以及越来越多的融资,使得协调变得更加可控。
真正的制约在于别处:将并非你制造的GPU,由你无法控制的运营商运营,聚合到行为如同单一机器的集群中。
这正是这种方法要解决的难题。
NVDA3.71%
SHAZ8.88%
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
70% 的公司表示他们使用人工智能。但只有不到十分之一的企业在生产环境中运行着真正的智能体。
这一差距存在于斯坦福大学的 AI 指数中,这是目前最常被引用、偏见最少的人工智能数据集,并非由某个利益相关实验室发布。
仅谷歌去年就在人工智能基础设施上花费了超过 1500 亿美元。前沿实验室的收入正以历史性的速度增长,而计算支出也同步攀升,并未像通常基础设施规模化后那样在收入中占比下降。
采用从来不是瓶颈。瓶颈在于运行一个永不停止的工作负载,检查工具、采取行动、保持状态,同时成本结构不会在收益复利之前吞噬收入。这是一个基础设施问题,而非智能问题,这也解释了为什么 70% 的采用率只带来个位数的实际部署。
这两个数字之间的差距,正是一个尚未有人为其构建基础设施的市场。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
2026年人工智能的制约因素不是模型质量,而是电网容量。
PJM刚刚发布了弗吉尼亚州容量电价833%的涨幅。该州目前约40%的电力输送给数据中心,并且进口的电力比加利福尼亚州还多。都柏林消耗着爱尔兰国家电网近80%的电力。法兰克福则占到区域供电量的42%。
国际能源署认为,到2030年数据中心的需求将再次大致翻倍,而美国正在开发的项目中有一半集中在已经使电网紧张的地区。
我们正越来越擅长压缩每个代币的焦耳消耗,并且人工智能在每项任务上的效率也在持续提升。但运行人工智能的地理位置并未改变。而这一地理位置正是无人能够优化掉的制约因素。
查看原文
post-image
  • 赞赏
  • 2
  • 转发
  • 分享
nil3437:
美光(MU)空投:注册即可零门槛赢取美股,CFD交易奖励高达8股MU https://www.gate.com/campaigns/5371?ch=4468&ref=VLARAFKMAQ&ref_type=132
查看更多
花时间研究推理数据,反复出现的一项统计是这样的:
到2026年,70%的AI推理发生在边缘。不是在超大规模数据中心,也不在AWS上。对于工业系统、自动化设备以及联网设备而言,与云端服务器之间的往返通信并非只是“延迟问题”,而是一种故障模式。
1060亿美元的推理市场之所以增长,并不是因为人们向AI发送了更多“聊天”查询;增长的原因在于,AI正在被嵌入到持续运行的物理基础设施中。这些基础设施运行在没有可靠网络的环境里,而且无法承受等待。
超大规模的建设确实存在。7250亿美元的资本开支承诺也确实存在。只是投向了那30%。
查看原文
  • 赞赏
  • 评论
  • 1
  • 分享
显然,离这种实体技术近几乎与真正采用它没有多大关系。
加利福尼亚州汇聚了所有重要的前沿AI实验室。纽约的财富500强企业数量比任何其他州都多。但两者都被科罗拉多州超过了:该州实现了23.2%的商业AI采用率,而纽约为13.8%。
科罗拉多州和亚利桑那州所拥有的,并不是什么更好的基础设施或人才。关键在于——在行业发出“安全”信号之前,它们就愿意先动手。离技术最近的州往往也是部署最慢的,因为它们在“事物如何按原有方式运行”上投入得最多。
到2026年,四分之三的美国企业仍未以任何有意义的方式使用AI;而关于AI如何重塑经济的每一条头条新闻,都在描绘一个这样的世界:77%的企业尚未进入。
尽管模型每个月都在变得更好、成本也更低,但最终仍归结为一个分发(distribution)问题;而解决分发的那一层,从来都不是构建产品的那一层。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
理论上,人工智能成本本应已经暴跌。
同样的前沿级任务,在2023年GPT-4发布时每百万token成本30美元,如今GPT-5仅需1.25美元。三年间下降了96倍,且适用于所有公布价格的命名模型。
按照任何常规逻辑,企业AI账单本应大幅下降。然而,财富500强企业的平均AI预算从2024年的$7M 增至2026年的$19M 。两个预算周期内增长了近3倍。
原因在于:廉价的token不会被节省下来,而是被武器化。聊天机器人发射一次token就停止。而执行实际工作的智能体在相同任务上消耗5到30倍的token,一旦推理变得如此便宜,你就会将其指向一切。每次降价所释放的使用量都超过其节省的量。
成本中心并未缩小。它从模型层转移到了其下的基础设施层。真正的账单正在那里产生,而大多数公司尚未打开它。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
今年,AI计算领域悄然发生了一次反转,而这种反转改变了基础设施建设的真正目的。
2023年,AI计算中三分之二的算力用于训练,即构建模型的实际工作。另一小部分用于推理,即模型构建完成后实际运行的工作。但这一比例开始悄然反转。
根据德勤的数据,推理目前占三分之二,且仍在攀升,而用于运行推理的芯片今年已突破$50B 。
这一反转之所以重要(且并非百分比原因),在于训练和推理是两种截然不同的工作负载。训练是爆发式的,在一个巨型集群上完成,然后结束。推理从不停止。每次有人发送提示词或代理采取步骤时,推理都在运行,并且随着你增加的用户数量而扩展。一个是建设项目,另一个是永远增长的费用账单。
关于AI基础设施的所有假设都围绕训练展开,因为资金曾流向那里。然而,资金现在正转向不需要位于单一集群中运行的工作负载。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
两年前,这张图表上的开放模型几乎排在末尾。闭源实验室领先了好几代,正是这个差距让人们选择租用模型而非拥有自己的模型。
现在GLM-5.2在@ArtificialAnlys指数上排名第51位。
开放权重,中国实验室,总排名第五。并且将Fable从列表中剔除,因为它不可用,而开放权重模型的实际位置远比排名所显示的更接近顶端。
闭源模型的卖点一直是领先优势。付费使用API,接受条款,在你无法控制的东西上构建,因为模型足够领先,值得这样做。现在领先优势只剩几个百分点,而GLM在进入英伟达芯片限制名单的情况下仍达到了这一水平,这更加令人印象深刻。
溢价是根据差距来定价的。差距几乎消失,但溢价却没有变化。
好奇一年后我们会处于什么位置。
GLM1.97%
查看原文
  • 赞赏
  • 评论
  • 转发
  • 分享
关于AI计算的分化,很少有人正在用正确方式读懂它。
前沿训练每个季度都在更加集中:数千块GPU必须放在同一个地方,并用线缆连成一体。但在2026年,训练只占需求的30%。其余70%是推理,而在hyperscaler(超大规模云)上运行推理,意味着你要为那种为最苛刻工作负载建造的基础设施付费,却用来做最简单的任务。
在分布式网络上,同样的推理本可以便宜45%到75%,而对任何在测算AI基础设施预算的人来说,这个差距就是全部故事。
训练出于必要性而集中;推理则被拆分,因为当你不再需要为一个不需要AWS利润率的工作负载支付这些利润率时,在规模上这样做就不再说得通。
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享
最近一直在想GLM 5.2的新闻,大家都在讨论开源权重这个角度,但其实他们完全忽略了另一个截然不同的视角。
所有人的注意力都集中在中国实验室达到了前沿水平并开源了这一事实,但真正值得深思的是它是如何做到的。ZAI和其他中国实验室在2025年初就被切断了英伟达的供应,所以大概从那时起,它们就拿不到H100和H200芯片了。
他们却用一颗很可能由中国硅片训练的模型,达到了与前沿水平仅相差几个点的表现。 $128B
出口管制本意是拖慢中国。但实际上却迫使竞争转向了电力而非芯片——而电力恰恰是中国供应过剩的要素。中国一年新增了543吉瓦的装机容量,比整个印度的电网规模还大。
自2021年以来,中国新增的发电量已超过美国电网的总容量,而美国电网在AI需求的压力下已经不堪重负。
你可以限制芯片供应。但你无法限制电力。而当受限制的一方还在持续发布开源权重时,整个行业都将从中受益。
GLM1.97%
NVDA3.71%
查看原文
  • 赞赏
  • 评论
  • 转发
  • 分享
95%的企业GPU容量目前处于空闲状态。
这个数字来自Cast AI测量的23,000个真实生产集群,而不是一项普通的调查。
平均利用率为5%,而正是在英伟达将H200价格提高15%的同时发生的,这是20年来的首次涨价。大家说稀缺的硬件大部分其实都没有在使用。
如果你试图弄清楚为什么计算资源感觉难以获得,这就是原因。没有人会退还他们等待了数月的配额。因此,资源池以5%的利用率运转,按小时计费,稀缺性相互促进。这似乎是协调失败,而不是供应问题。
NVDA3.71%
查看原文
post-image
  • 赞赏
  • 评论
  • 转发
  • 分享