七月中旬,月之暗面发布 Kimi K3:总参数 2.8 万亿的混合专家模型,每个 token 激活 1040 亿,原生视觉,上下文一百万 token,权重随后全量开源。随模型放出的,是一份四十七页的技术报告。
我读它的立场与研究者不同。我的主业在临床和科研,AI 于我是生产工具;我同时付着 Claude 与 Kimi 两份订阅,前者是主力,后者是卫星。故此这份报告于我只需回答一个问题:哪些活该派给谁。以此为尺,四十七页里真正要读的约十页——第六章的评测与成本,第七章的案例研究,外加附录里聊天模板的一角;其余是训练与基建的工程细节,写给同行看,用户略过无妨。
分工的账
报告第六章把 K3 与 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8 等一线闭源模型放在同一张桌上比试,数字详尽,恰好拿来算分工的账。
K3 占优的项目,集中在三处。其一,联网调研:BrowseComp(考察多步网络检索的基准)91.2 分居首,且报告给出了单价——每任务 2.03 美元,约为 Claude 系最高档的十分之一。其二,网页开发:在第三方 WebDev Arena 榜上以 1678 Elo 登顶,为开源模型首次;厂商自家的盲评里与 Opus 4.8 同场竞技,净胜三十一个百分点。其三,超长任务:SWE-Marathon(马拉松式软件工程)42.0 分居首,案例研究里更有 24 小时的 GPU 内核优化与 48 小时的芯片设计全自主运行。此外,文档解析与视频理解两项,得分亦在同场诸模型之上。
Claude 守住的阵地同样清楚:研究级推理(HLE「人类最后的考试」带工具 63.0 对 56.0),长程复杂软件工程(FrontierSWE 86.6 对 81.2),办公与法律类知识工作(OfficeQA Pro 69.9 对 63.3),计算机操作,以及智能体的过程纪律(Agent Behavior Bench 75.5 对 65.0)——末一项管的是干活时守不守规矩,差距十个百分点,不算小。
于是分工表大体如下:
| 派给 Kimi K3 | 留给 Claude |
|---|---|
| 联网深度调研(91.2 居首,成本约十分之一) | 研究级推理(63.0 对 56.0) |
| 网页与网站开发(WebDev Arena 开源模型首次登顶) | 复杂长程软件工程(86.6 对 81.2) |
| 工具链密集型任务(MCPMark 94.5 居首;MCP 即模型调用外部工具的标准协议) | 办公与法律类知识工作(69.9 对 63.3) |
| 超长自主任务(24–48 小时案例) | 智能体过程纪律(75.5 对 65.0) |
| 文档解析、视频理解 | 日常对话质量 |
两个省钱的旋钮
报告对用户最实惠的两页,是成本曲线。
其一,推理强度。K3 分 low、high、max 三档,且三档并非同一模型换个提示词,而是分开强化训练、再蒸馏合一——low 档真被训练成省,max 档真被训练成花。成本曲线显示,high 档的编码成绩已打平 Opus 4.8 的 max 档,成本约三分之一。故日常宜用 high,硬骨头再开 max。
其二,上下文长度。一百万 token 是 K3 的招牌,但报告自己给出了一个耐人寻味的数字:BrowseComp 上,在 30 万 token 处做上下文压缩,得分 91.2;硬撑满一百万不做任何管理,反而 90.4。官方文档也顺势推荐 256k 版本——256k 以内效果相同,配额只耗 1M 版的一半。盘子的最大容量与该装多少,本就是两回事。
一桩趣闻:壳与芯的松绑
报告第 4.2 节记了一笔训练细节:K3 的强化学习环境里,复刻了 Kimi Code、Claude Code、Codex 等多家智能体外壳,训练时还随机变换配置,专防模型对某一家外壳产生依赖。效果立竿见影——厂商自家的编码基准上,K3 在 Claude Code 壳里跑出 73.7 分,在自家 Kimi Code 壳里反而只有 72.9。
模型厂商亲手把模型与外壳解耦,这在一年前还难以想象。对用户而言,这意味着积累在某一套工作流里的配置与习惯,迁移成本正在下降;壳的忠诚度,往后怕是越来越不值钱了。
账要两面算
勿庸讳言,以上分数几乎全部出自厂商自报,第三方分析已指出:同一模型换一套外壳,基准分可差十到二十六分;权重放出未久,独立复现尚付阙如。且 Claude 的部分失分含拒答与降级——它在若干任务上因安全策略退避,分数遂低,这与能力不逮是两码事。但也必须看到,第三方榜单大体印证了报告的自我定位:Artificial Analysis 智能指数列第四,仅次于 Fable 5 与 GPT-5.6 Sol;Vals 指数列第二。说 K3 是当下最强的开源模型,庶几近之;说它全面追平闭源第一梯队,则言之尚早。
我不打算在两家之间站队。订阅费投给谁,向来不该是信仰问题——摆开数字,各派各活,账目自会说话。