# Moonshot AI 发布了规模最大的开源 AI 模型 Kimi K3
中国 AI 初创公司 Moonshot AI 介绍了 Kimi K3——全球首个 3T 级别的开源模型,参数规模达到 2.8 万亿,原生视觉,并支持 100 万 tokens 的上下文。根据项目方的自评,在总榜单上它仅输给了专有模型 Claude Fable 5 和 GPT 5.6 Sol。
Kimi K3 建立在新的 Kimi Delta Attention(KDA)以及 Attention Residuals(AttnRes)架构之上。KDA 能更高效地处理长数据序列,而 AttnRes 并不是以同样方式从所有层中提取所需信息,而是进行选择性提取。由此,模型能更深入理解上下文,并在处理复杂文本时仍能保持意义。
稀疏性由 Stable LatentMoE 框架负责:在 896 位专家中,同时只有 16 位在工作。这再结合新的数据与训练设置,使得效率相较 K2 提升了 2.5 倍。
据开发者称,在过去 12 个月的最后 12 个月中,有 9 个月里 Kimi 模型都保持了开源模型的规模纪录。
来源:Kimi 博客。Moonshot AI 的新模型已经在官网、Kimi Work、Code 和 API 上上线。默认启用最大推理模式,其他模式将稍后推出。完整权重与报告将于 7 月 27 日发布。
在部分测试中,K3 的表现高于 Fable 5 和 GPT-5.6 Sol,但在其他测试中明显落后。它在 SWE Marathon(42 对 35 和 39)、BrowseComp(91.2 对 88 和 90.4)以及 Program Bench(77.8 对 76.8 和 77.6)中处于领先地位。在 Terminal Bench 2.1 上,K3 得分为 88.3:高于 Fable 5(84.6),且仅比 Sol(88.8)低 0.5 分。
同时,在 FrontierSWE 上,K3 的得分为 81.2,而 Fable 5 为 86.6;在 HLE-Full 上,K3 为 43.5,而 Fable 5 为 53.3。测试方法也有所不同:部分模型通过 Claude Code 进行评估,另一部分则通过 Codex 或自家 KimiCode。
K3 能在几乎不需要人工参与的情况下进行长时间的工程会话,能够面向大型代码库并管理终端工具。
在一次 GPU 核优化测试中,模型的各个核独立运行,最长可达 24 小时,完成四项任务——包括头维度为 512 的 AttnRes、KDA 和 MLA 核——分别在 NVIDIA H200 以及另一家厂商的 GPU 上执行。K3 的结果达到了 Fable 5 的水平,并显著超过 Opus 4.8、GPT-5.6 Sol 与 GPT-5.5。在开发的后期阶段,K3 的早期版本就能在 Moonshot 团队内部独立完成此类优化中的大部分工作。
来源:Kimi 博客。另一个亮点是,这个模型从零开始独立编写了 MiniTriton——一种用于 GPU 核的紧凑型编译器,在 MLIR 之上使用自有的 IR 层,并生成 PTX 代码。
作为演示,K3 能基于其自有架构,独立为神经网络设计芯片。
自主运行耗时 48 小时:模型使用开源 EDA 工具以及 Nangate 45nm 库。该芯片占用面积为 4 mm²,运行频率保持在 100 MHz,并在仿真中每秒输出超过 8700 个 tokens。芯片包含 146 万个标准单元、0.277 MB SRAM,以及集成了内置去量化的 INT4 MAC 阵列。
K3 还结合 3D 推理、代码与视觉能力,用概念、图片和视频创建游戏与交互式原型。
在一个案例中,K3 复现了计算天体物理中的通用 I-Love-Q 关系。这一过程耗时约两小时,而不是资深研究员需要的一到两周。模型核验了 20 多篇科学论文,评估了 300 多个状态方程,在已发表的公式中找到了不一致之处,并使用 Python 编写了 3000 多行代码,最终将结果整理成交互式 HTML 仪表板。
在另一个案例中,K3 制作了一份关于 ASIC 芯片产业 42 年历史的交互式报告:在进行 120 轮递归式自我改进的过程中,处理了来自 87 份季度报告的 11 000 多页,以及 99 份原始 PDF。
来源:Kimi 博客。借助对视频的原生处理能力,K3 能够剪辑视频:在一个示例中,模型制作了一段以 3Blue1Brown 风格解释其自有架构的科普动画;在另一个示例中,它从 56 个原始剪辑中独立剪好了关于自身发布的预告片,包括挑选镜头、与音乐同步以及音频处理。根据 Moonshot 的评估,这类工作对资深剪辑师需要 1-2 天,对新手则需要 3-5 天。
项目团队强调,K3 对在会话中途切换代理环境时推理历史的丢失较为敏感,并可能在模糊的情境中表现出过度主动性。在易用性方面,模型目前仍明显落后于 Fable 5 和 GPT-5.6 Sol。
提醒一下:在 2025 年 7 月,Moonshot AI 发布了 Kimi K2——该系列首个拥有 1 万亿参数的模型,并很快成为面向代理任务的领先开源系统之一。
13.1万 热度
20.54万 热度
1.24万 热度
111.53万 热度
5.8万 热度
Moonshot AI 发布了最大的开放式公开 AI 模型 Kimi K3 - ForkLog
中国 AI 初创公司 Moonshot AI 介绍了 Kimi K3——全球首个 3T 级别的开源模型,参数规模达到 2.8 万亿,原生视觉,并支持 100 万 tokens 的上下文。根据项目方的自评,在总榜单上它仅输给了专有模型 Claude Fable 5 和 GPT 5.6 Sol。
Kimi K3 建立在新的 Kimi Delta Attention(KDA)以及 Attention Residuals(AttnRes)架构之上。KDA 能更高效地处理长数据序列,而 AttnRes 并不是以同样方式从所有层中提取所需信息,而是进行选择性提取。由此,模型能更深入理解上下文,并在处理复杂文本时仍能保持意义。
稀疏性由 Stable LatentMoE 框架负责:在 896 位专家中,同时只有 16 位在工作。这再结合新的数据与训练设置,使得效率相较 K2 提升了 2.5 倍。
据开发者称,在过去 12 个月的最后 12 个月中,有 9 个月里 Kimi 模型都保持了开源模型的规模纪录。
基准测试结果
在部分测试中,K3 的表现高于 Fable 5 和 GPT-5.6 Sol,但在其他测试中明显落后。它在 SWE Marathon(42 对 35 和 39)、BrowseComp(91.2 对 88 和 90.4)以及 Program Bench(77.8 对 76.8 和 77.6)中处于领先地位。在 Terminal Bench 2.1 上,K3 得分为 88.3:高于 Fable 5(84.6),且仅比 Sol(88.8)低 0.5 分。
同时,在 FrontierSWE 上,K3 的得分为 81.2,而 Fable 5 为 86.6;在 HLE-Full 上,K3 为 43.5,而 Fable 5 为 53.3。测试方法也有所不同:部分模型通过 Claude Code 进行评估,另一部分则通过 Codex 或自家 KimiCode。
编码与代理任务
K3 能在几乎不需要人工参与的情况下进行长时间的工程会话,能够面向大型代码库并管理终端工具。
在一次 GPU 核优化测试中,模型的各个核独立运行,最长可达 24 小时,完成四项任务——包括头维度为 512 的 AttnRes、KDA 和 MLA 核——分别在 NVIDIA H200 以及另一家厂商的 GPU 上执行。K3 的结果达到了 Fable 5 的水平,并显著超过 Opus 4.8、GPT-5.6 Sol 与 GPT-5.5。在开发的后期阶段,K3 的早期版本就能在 Moonshot 团队内部独立完成此类优化中的大部分工作。
芯片设计与游戏开发
作为演示,K3 能基于其自有架构,独立为神经网络设计芯片。
自主运行耗时 48 小时:模型使用开源 EDA 工具以及 Nangate 45nm 库。该芯片占用面积为 4 mm²,运行频率保持在 100 MHz,并在仿真中每秒输出超过 8700 个 tokens。芯片包含 146 万个标准单元、0.277 MB SRAM,以及集成了内置去量化的 INT4 MAC 阵列。
K3 还结合 3D 推理、代码与视觉能力,用概念、图片和视频创建游戏与交互式原型。
知识与视频
在一个案例中,K3 复现了计算天体物理中的通用 I-Love-Q 关系。这一过程耗时约两小时,而不是资深研究员需要的一到两周。模型核验了 20 多篇科学论文,评估了 300 多个状态方程,在已发表的公式中找到了不一致之处,并使用 Python 编写了 3000 多行代码,最终将结果整理成交互式 HTML 仪表板。
在另一个案例中,K3 制作了一份关于 ASIC 芯片产业 42 年历史的交互式报告:在进行 120 轮递归式自我改进的过程中,处理了来自 87 份季度报告的 11 000 多页,以及 99 份原始 PDF。
限制
项目团队强调,K3 对在会话中途切换代理环境时推理历史的丢失较为敏感,并可能在模糊的情境中表现出过度主动性。在易用性方面,模型目前仍明显落后于 Fable 5 和 GPT-5.6 Sol。
提醒一下:在 2025 年 7 月,Moonshot AI 发布了 Kimi K2——该系列首个拥有 1 万亿参数的模型,并很快成为面向代理任务的领先开源系统之一。