Kimi K3 来了:3-5 个月差距收窄的那条线,到底颠覆了什么、没颠覆什么
目录
Kimi K3 发的那一周,两个我都很服气的人在写同一件事。Nathan Lambert 的文章标题叫《Kimi K3: The open-weights escalation》,结论是「中美前沿模型的差距刚刚塌了一截」。Zvi Mowshowitz 写了一篇《Do not get carried away》,给的判断是「还差四到六个月」。两个人都对。这中间的张力——一边是「2026 年最颠覆性的发布」,另一边是「别上头」——就是这篇文章的整个故事。营销人想知道到底该不该上 K3,需要把这两个判断一起吃下去。
Kimi K3 是 Moonshot(月之暗面)在 2026 年 7 月 16 日发布的,完整开源权重定在 7 月 27 日放出。下面是真的新东西、是真炒作的部分、以及我明天早上会做的事。
真新东西:四个,不是单独一个
「颠覆性」的讨论不是某一件事,是下面这一组组合。
2.8 万亿参数,开源权重。 单看 2.8T 没什么——前沿模型早就破万亿了。新的是「把它开源出来」。K3 是迄今发布的最大开源权重模型,闭源实验室能造出来的东西、和开源权重能造出来的东西之间那条线,肉眼可见地缩了一截。
896 个专家,每次激活 16 个。 Mixture-of-Experts(混合专家,MoE)架构下,每个 token 实际只激活大约 1.8% 的参数。所以 2.8T 的模型跑起来算力成本相当于一个明显更小的稠密模型——这也是为什么它的 API 能定到输入 $3/百万 token、输出 $15/百万 token,和 Anthropic Sonnet 一个档位,而不是 $30+。
100 万 token 上下文,原生多模态。 长到一次能吞下一个整站审计、一季度的竞品抓取、或者一年的品牌指南。视觉理解是原生的,不是后接的。
始终开着的「思考模式」(thinking mode)。 这是最安静但也最颠覆的那一条。大多数推理模型都需要单独切一个 variant——你需要的时候再切到「那个会思考的版本」。K3 默认就在思考。意味着:以前每一次调用都要做一次「要不要切到推理模型」的决策,这个成本消失了。对一个跑很多小步的 agent 来说,那是少一层摩擦。
让这套定价站得住的两个架构创新
定价故事能成立,是因为 Moonshot 端出了两个真正新的东西:
- Kimi Delta Attention——一种混合线性注意力机制,Moonshot 报告在长上下文解码上比标准 attention 快约 6.3 倍。没有它,1M 上下文同价位模型根本不可能以对话级速度跑起来。
- Attention Residuals——标准残差连接的替代品,Moonshot 报告训练效率提升约 25%,额外算力开销不到 2%。这才让「在中国算力约束下训练一个 2.8T 模型」这件事在经济上变得可行。
这些不是借来的想法。「中国 AI = 美国实验室蒸馏」这套叙事——2024、2025 年很多美国评论人拿它用得很顺手——这次发布之后明显更站不住了。Moonshot 在解决 OpenAI 和 Anthropic 在解决的同一组问题,有些地方甚至先到了。
基准测试的冷静读法
按独立测试,目前的前沿排名是这样:
- Frontend Code Arena 第一。 K3 拿了头名。这是开发者社区在「能不能上线生产 UI」这件事上最信的一个基准。
- DeepSWE 67.5 对 GLM 5.2 的 46.2。 真实软件工程问题上 21 分的差距,是这次发布最大的单模型胜利。
- Terminal Bench 2.1:88.3 对 GPT-5.6 Sol 的 88.8。 终端类开发工作上基本平手。
- Vals AI Index 第二,Artificial Analysis Intelligence Index 第三。 稳稳在前沿,但综合上仍落后 Claude Fable 5 和 GPT-5.6 Sol。
需要扣的那部分——也是 Zvi 的冷静读法站得住的地方——是 Moonshot 发布的基准全部跑在「最大推理档位」(max reasoning effort)下,消耗的 token 比同行在同档测试里用的多得多。独立测试把 K3 的原始准确率定在 46%(K2.6 是 33%),但幻觉率也上升到了大约 51%。准备好面对锯齿状的实用表现:K3 在一些任务上会非常出色,在另一些任务上会明显弱一截。
真正应该改变你路由决策的是单任务成本。Artificial Analysis 测出每个任务 K3 大约 $0.94,GPT-5.6 Sol $1.04,Claude Opus 4.8 $1.80。同样是前沿档输出,单任务账单更低,因为 K3 的回答在 token 上更省。
我明天会做的三件事
按对你现有管线的冲击大小排:
- 如果你已经在用 OpenRouter 做多模型路由,把 K3 加进轮换。现在花人工复核时间的那些产出(lead 文案、高管备忘、任何品牌声音敏感的东西),同一个 prompt 同时丢给 K3、Claude Fable 5、GPT-5.6 Sol 各跑一遍。在「深度推理能换回成本」的那类任务上,单任务经济账偏 K3。
- 如果你有长上下文管线——内容库的 RAG、整站审计、季度竞品 dump——K3 的 1M 上下文 + 默认开启的思考模式,能把几个 agent 步压成一步。暂时不用重写什么,把现有管线对 K3 重跑一遍,看步数会不会掉下来。
- 不要整体切换。 K3 在最大档位烧 token。对高量低风险任务(meta description、alt text、内链草稿),更小更便宜的模型(包括 K2.6、GLM 5.2、现有的本地模型栈)仍然在成本上赢。把 K3 当成轮换里新加的高端选项,不是替换品。
颠覆的不是 K3,是速度
这场发布里最重要的数字不是 2.8T,是 3-5 个月——Nathan Lambert 给出的当前「开源对闭源」的性能差距估计,从 2026 年初大多数分析师还在引用的 6-9 个月直接砍下来。一次发布,差距砍半。不管你现在的模型栈是什么,按这个节奏提前规划那条差距继续收窄。
把模型选择当季度决策的人(每 3 个月重新评估、跑新基准、栈里至少换进一个新模型),会一直站在对的位置。2025 年定下 LLM 栈之后到现在没看过一眼的人,18 个月后会在重新搭。 这不是预测,过去两年就是这么走过来的。
Kimi K3 不是「前沿动的那一天」。它是「你能实时看见前沿在动」的那一天,是一家中国实验室明显加入了架构对话(而不是只加入价格对话)的那一天。两件事都是结构性的,都不意味着你周一早上就该重写一整套打法。