7 月 16 日,北京。月之暗面(Moonshot AI)发布了旗下迄今能力最强的大模型——Kimi K3。
2.8 万亿参数,全球首个开源的 3T 级模型,100 万 token 上下文窗口,原生视觉理解,在多个编程和 Agent 基准测试中登顶第一。
这不是一次普通的版本迭代。这是一次对全球 AI 格局的正面冲击。
一、先看数字:2.8T 到底意味着什么
当我们谈论大模型的参数量时,很多人会条件反射地问:”更大就一定更好吗?”
答案是:不一定,但这次不一样。
Kimi K3 的 2.8 万亿(2.8T)参数,让它成为迄今为止全球最大的开源权重模型。作为参照,此前开源模型中参数量最大的 DeepSeek V4 Pro 约为 1.6T,K3 直接将其拉开了 75% 的身位。即便是业界普遍估计参数量在 1.7T 左右的 GPT-4,在 K3 面前也显得”轻量”了不少。
但真正关键的,不是总参数量有多大,而是它怎么用这些参数。
K3 采用的是混合专家架构(Mixture of Experts, MoE),在 896 个专家中,每次推理只激活 16 个——也就是说,每个 token 实际动用的参数只有约 500 亿(50B),仅占总量池的 1.8%。
这个设计极其精妙。它意味着 K3 拥有了一个超大模型的知识储备和表达能力,但在推理时的计算成本却只相当于一个 500 亿参数的模型。这就是为什么它能把 API 价格定在每百万 token 输入 3 美元、输出 15 美元的水平——一个远低于同级别闭源旗舰模型的价位。
用 2.8T 的大脑,干 50B 的活,花 1/3 的钱。 这就是 K3 最朴素也最有杀伤力的价值主张。
二、架构拆解:不只是”大”,更是”新”
如果只是把参数堆到 2.8 万亿,那 K3 充其量是一个暴力美学的产物。但月之暗面这次拿出了一整套自研架构,这才是真正值得行业关注的地方。
KDA:让百万 token 不再昂贵
传统 Transformer 的注意力机制是二次方复杂度的——上下文越长,计算量呈平方级增长。这就是为什么大多数模型在处理超长文本时会变得又慢又贵。
K3 引入了 Kimi Delta Attention(KDA) 混合线性注意力机制。它的大致思路是:对序列的大部分内容使用线性递归进行快速处理,只在特定间隔插入完整注意力运算。据官方数据,在 100 万 token 的满上下文长度下,KDA 的解码速度比标准注意力快 6.3 倍。
这意味着什么?意味着 K3 真的能用满 100 万 token 的上下文窗口,而不是把它当摆设。
Attention Residuals:跨深度的记忆选择
传统深度网络中,信息是从浅层到深层逐层累积的。但 K3 的 Attention Residuals(AttnRes) 打破了这个模式——它允许模型在跨深度层面进行选择性检索,而不是均匀地堆叠表示。
你可以把它理解为一个”选择性记忆”机制:模型不是把所有信息一视同仁地往前传,而是在不同深度层之间建立”快捷通道”,让关键信息能够直接被检索到。
Stable LatentMoE:896 个专家的调度艺术
896 个专家选 16 个,听起来简单,实际上路由(routing)是 MoE 架构中最难的问题之一。传统的路由方法依赖启发式规则和敏感的超参数调整,容易出现负载不均衡。
K3 用了一套叫 Stable LatentMoE 的框架,配合 Quantile Balancing(分位数平衡) 技术,直接从路由分数的分位数推导专家分配,消除了启发式更新和敏感超参的依赖。
用更直白的话说:它让 896 个专家的工作分配变得更公平、更稳定、更可预测。
训练工程:从第一步就为推理优化
一个容易被忽视但极其重要的细节:K3 从 SFT(监督微调)阶段就开始应用 量化感知训练(QAT),权重精度为 MXFP4,激活精度为 MXFP8。
这意味着 K3 在训练时就”知道”自己将来要以低精度运行,而不是训练完再压缩。这种”原生量化”策略让它在推理时具有更广泛的硬件兼容性和更低的部署门槛。
此外,K3 还引入了 Per-Head Muon 优化器(独立优化每个注意力头)和 SiTU 激活函数(改进激活控制),这些都是在底层架构层面的创新,而非简单的规模扩展。
官方透露,相比上一代 K2,K3 的整体扩展效率提升了约 2.5 倍。
三、跑分实测:在编程和 Agent 领域称王
架构再漂亮,最终还是要看能力。而 K3 的能力,用跑分说话——尤其是在它定位的核心场景:长程编程和 Agent 任务。
编程基准:六项核心测试
| 基准测试 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 88.3 | 88.8 | 84.6 | 84.6 |
| Program Bench | 77.8 | - | - | - |
| SWE Marathon | 42.0 | - | 35.0 | 40.0 |
| Frontend Code Arena | 1679(第一) | - | 第二 | - |
几个亮点值得放大看:
Terminal Bench 2.1(终端代码生成与调试):K3 拿下 88.3 分,与榜首 GPT-5.6 Sol 仅有 0.5 分的差距。这个 0.5 分的差距意味着什么?意味着在最接近真实开发场景的终端编程任务上,开源模型已经几乎追平了全球最贵的闭源旗舰。
SWE Marathon(极限编码挑战):K3 以 42.0 分领跑全场,而 Claude Fable 5 只有 35.0 分。这不是”追平”,这是反超——而且是超过了一个公认在编程领域极强的模型整整 7 分。
Frontend Code Arena:K3 以 1679 分位列第一,直接将 Claude Fable 5 挤到了第二。
Agent 基准:全面统治
如果说编程能力展示的是 K3 的”硬实力”,那 Agent 基准则展示了它的”综合调度”能力——这是衡量一个模型能否真正”干活”的关键。
| 基准测试 | Kimi K3 | 排名 |
|---|---|---|
| BrowseComp(网页浏览智能体) | 91.2 | 第一 |
| SpreadsheetBench 2(表格处理智能体) | 34.8 | 第一 |
| AutomationBench(自动化智能体) | 30.8 | 第一 |
| CharXiv(多模态视觉智能体) | 91.3 | 紧随 Fable 5 |
在 Agent 类基准中,K3 展现了全面统治力——三个核心测试全部拿下第一。
更值得关注的是 BrowseComp 的 91.2 分。这个基准测试考察的是模型在网页浏览场景中的智能体能力,而 K3 在使用 100 万 token 上下文窗口且不做上下文压缩时,得分高达 90.4——这意味着它可以在极长的上下文中保持稳定的信息检索和推理能力。
综合智能指数:距离顶级仅一步之遥
独立评测机构 Artificial Analysis 给 K3 的智能指数打出了 57 分,介于 Claude Opus 4.8(56 分)与 GPT-5.6 Sol(59 分)、Claude Fable 5(60 分)之间。
月之暗面官方也坦诚承认:K3 的整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol 这两款闭源旗舰。但在全套评测中,K3 稳定超越了其他所有模型,包括 GPT-5.5 和 Claude Opus 4.8。
这是一个历史性的位置:开源模型第一次在综合智能上逼近了最顶级的闭源模型,差距缩小到了个位数。
四、成本效率:真正的杀手锏
跑分很重要,但对企业和开发者来说,真正决定用不用的是性价比。
在 Kimi Code Bench V2 上,K3 Max 以单次约 4 美元的成本取得了 72.9 分;而 Claude Fable 5 虽然达到 76.9 分,单次成本却超过了 10 美元。
换算一下:K3 用 Fable 5 约 1/3 的成本,拿到了 95% 的性能。
对于日均调用上万次 API 的企业来说,这个差距意味着真金白银的节省。按一个月 100 万次调用计算,选择 K3 而非 Fable 5,每月可节省约 600 万美元。
从绝对定价来看:
- 输入:缓存命中 0.3 美元/百万 token,缓存未命中 3 美元/百万 token
- 输出:15 美元/百万 token
- 上下文窗口:约 100 万 token
换算成人民币(参考官方公布的国内定价):
- 缓存命中输入:2 元/百万 token
- 缓存未命中输入:20 元/百万 token
- 输出:100 元/百万 token
K3 没有延续中国开源模型惯用的”地板价”策略,而是直接进入了国际主流商业模型的定价区间。但与 Fable 5、GPT-5.6 等旗舰模型相比,它的实际使用成本仍然显著更低。
五、马斯克点赞:一个信号
K3 发布后,特斯拉 CEO 埃隆·马斯克在官方动态下留言了一个词:”Impressive(令人印象深刻)。”
这个细节看似不起眼,实则意味深长。
马斯克是 xAI(Grok 系列模型)的创始人,本身就是大模型赛道的参与者。一个竞争对手的掌舵人公开点赞另一家公司的模型,在硅谷并不常见。这至少说明,K3 的能力表现已经引起了全球顶级 AI 从业者的注意。
更重要的是马斯克点赞的时机。当前全球 AI 市场正处于一个微妙的转折点:
- 成本焦虑蔓延:Anthropic 和 OpenAI 的旗舰模型 API 费用持续高企,越来越多企业开始质疑”值不值”。
- 开源力量崛起:从 DeepSeek V4 到 Kimi K3,中国开源模型在规模和能力上的追赶速度超出了多数人的预期。
- 数据主权需求:越来越多的企业和国家要求 AI 模型可以在本地部署,而非完全依赖云端 API。K3 的开源权重(将于 7 月 27 日在 Modified MIT 许可下完整发布)恰好满足了这一需求。
六、生态布局:K3 不只是一个模型
K3 的发布,不只是多了一个更强的模型选项——它背后是月之暗面一整套产品生态的升维。
Kimi Agent:自主任务执行
K3 驱动的 Kimi Agent 是一个端到端的自主 AI 助手,内置 20+ 工具,能完成:
- 网站生成与部署:零代码创建响应式 Web 应用
- 文档处理:Word、PDF、Markdown 编辑生成
- 数据分析:Excel/CSV 数据分析与可视化
- 幻灯片生成:自动化 PPT 制作
- 深度研究:生成万字以上研究报告
它的工作流程是:任务规划 → 工具调用 → 自主执行 → 错误自修复 → 交付成果。
Agent Swarm:最多 300 个子智能体并行
这是 K3 最具想象力的能力之一。Agent Swarm 允许模型将一个复杂任务拆解为最多 300 个子任务,分配给子智能体并行执行。
想象一下:你让 AI “分析整个行业的竞争格局”,它不是串行地一个个查,而是同时派出几十甚至上百个”小弟”分头调研、收集数据、撰写分析,最后汇总成一份完整报告。
Kimi Claw:5000+ 技能的云端自动化
Kimi Claw 是月之暗面推出的云端自动化工具,内置 5000+ 技能,可以在云端自动完成各种复杂任务。它与 K3 的结合,让”AI 干活”从概念变成了可操作的现实。
全平台覆盖
K3 已经在 Kimi 网页版(kimi.com)、Kimi App、Kimi Work 桌面客户端、Kimi Code 以及 Kimi API 开放平台同步上线。初始思考强度为 Max,后续将增加 Low 和 High 两种模式。
此外,面向企业的 Kimi Hosted Agent 托管平台正在筹备中,将提供 Agent 运行环境及隔离沙箱等能力。
七、被验证的采用:K2 的遗产
K3 并非凭空出现。月之暗面的 Kimi 系列模型此前已经在全球范围内获得了真实的生产环境验证。
据 Fortune 报道,AI 编程创业公司 Cursor 使用 Kimi 模型协助构建了其编程智能体 Composer 2;DoorDash 的 CTO Andy Fang 表示已经将部分底层工程工作委托给 Kimi K2.6 完成;Thinking Machines 实验室使用 Kimi K2.5 生成了其 Inkling 模型的早期后训练数据。
国内方面,值得买科技在 K3 发布后第一时间完成接入,将其应用于”什么值得买”App 的消费内容生成和消费智能体”张大妈”的决策能力提升。值得买科技还推出了大模型服务平台 OpenHubs,同步接入 K3。
这些不是概念验证,是真实的商业部署。
八、冷静的视角:K3 还不完美
作为一篇负责任的软文,我必须同时指出 K3 的局限性——这不是给它泼冷水,而是帮助潜在用户做出更明智的决策。
幻觉率仍然偏高
独立测试显示,K3 在提升准确性的同时,幻觉率也相应上升,约在 51% 左右。这意味着对于事实敏感型任务(如法律分析、合规审查、医疗诊断等),K3 的输出仍然需要严格的事实核查机制。
相比之下,Claude Fable 5 和 GPT-5.6 Sol 在幻觉控制方面表现更优。如果你的应用场景对事实准确性有硬约束,建议采用混合路由策略:编程和前端生成走 K3,高风险推理走闭源旗舰。
过度主动倾向
月之暗面官方承认,K3 在训练中特别强调了长时程、高难度任务的执行能力。这导致一个有趣的副作用:当 K3 在任务执行中遇到小问题或用户意图模糊时,它可能会自作主张替用户做出决定。
如果你的应用需要智能体在严格定义的边界内操作,避免过度即兴发挥,建议在系统提示或 AGENTS.md 中施加更明确的行为约束。
思考历史的敏感性
K3 在”保留思考历史”模式下训练。如果 Agent 框架未能正确传回所有历史思考内容,或者在会话中途从其他模型切换到 K3,生成质量可能变得不稳定。月之暗面推荐使用经过兼容性验证的框架(如 Kimi Code),并避免在会话中途切换模型。
自部署门槛
虽然 K3 是开源模型,但 2.8 万亿参数的体量意味着自部署只对拥有大规模 GPU 集群的组织才现实。对于绝大多数开发者和中小企业来说,API 仍是唯一实际可行的接入方式——至少在权重正式发布后的初期是如此。
九、从 K2 到 K3:月之暗面的进化节奏
理解 K3 的意义,需要放在月之暗面整个产品线的进化时间线上看:
- 2023 年:推出 Kimi Chat,以超长文本分析能力切入市场
- 2024 年:推出 Kimi 浏览器助手,支持长文本分析和 AI 搜索
- 2025 年 1 月:发布 K1.5 视觉思考模型
- 2025 年 7 月:开源总参数 1 万亿的 Kimi K2 基础模型
- 2025 年 9 月:Kimi K2 正式发布(32B 活跃 / 1T 总参数)
- 2025 年 9 月:推出 “OK Computer” Agent 模式
- 2026 年 1 月:发布 K2.5,改进 Office 技能和 Agent 能力
- 2026 年 2 月:Kimi Claw 公测上线
- 2026 年 4 月:发布 K2.6 并开源,在编码、长程执行和 Agent Swarm 方面领先
- 2026 年 7 月 16 日:Kimi K3 发布
从 K2 的 1T 参数到 K3 的 2.8T,从单纯的对话模型到 Agent Swarm 和 Kimi Claw 的完整生态,月之暗面用一年时间完成了从”追赶者”到”挑战者”的身份转换。
十、更大的图景:开源 vs 闭源的拐点
K3 的发布,在更宏观的层面上标志着一个拐点:开源大模型与闭源大模型之间的差距,已经缩小到了可能不再构成决策性障碍的程度。
过去两年,业界的主流叙事是”闭源模型(GPT-4、Claude)遥遥领先,开源模型(Llama、Mistral)紧追其后”。但 K3 的出现让这个叙事开始松动:
- 编程能力:K3 在多个编程基准上已经反超闭源旗舰
- Agent 能力:K3 在智能体类测试中全面登顶
- 成本效率:K3 的单任务成本约为闭源旗舰的 1/3
- 可部署性:开源权重让数据主权和本地部署成为可能
当然,闭源模型在综合推理、幻觉控制等方面仍有优势。但关键问题是:对于 80% 的实际应用场景,这种差距是否值得多花 3 倍的价格?
越来越多的企业开始给出否定的答案。这正是马斯克那句 “Impressive” 背后的潜台词——不是因为 K3 比他的 Grok 更强,而是因为它代表了开源力量正在以前所未有的速度逼近临界点。
写在最后
Kimi K3 不是一个完美的模型。它的幻觉率需要改善,它的过度主动倾向需要约束,它的自部署门槛仍然很高。
但 K3 是一个标志性的模型。
它标志着中国 AI 实验室不再满足于”做平替”,而是开始在核心技术架构上提出自己的方案——KDA、AttnRes、Stable LatentMoE,这些都是来自月之暗面的原创贡献,而非对西方架构的简单复刻。
它标志着开源大模型从”够用”走向”好用”——在编程和 Agent 这两个最具商业价值的场景中,K3 已经可以与全球最贵的闭源模型正面对话。
它标志着 AI 的竞争维度正在发生变化——从”谁的模型更聪明”变成”谁的模型更聪明且更便宜且更开放”。
7 月 27 日,K3 的完整权重将以 Modified MIT 许可正式开源。到那时,这场关于”开源能不能追上闭源”的争论,或许会有一个更清晰的答案。
但至少现在,K3 已经给出了一个足够有力的回应。
相关链接:
- 官方技术博客:https://www.kimi.com/blog/kimi-k3
- Kimi 体验地址:https://kimi.com
- API 开放平台:通过 Kimi 官网接入
本文基于公开信息整理撰写,部分数据来自月之暗面官方发布材料和独立评测机构报告。AI 模型能力可能随版本更新而变化,请以最新官方信息为准。