清华博士解读Kimi K3:大模型更多是改良性演进
清华博士解读Kimi K3:大模型更多是改良性演进
2026-08-27

本期访谈请到清华计算机系博士在读、专注大模型架构与预训练的孙宇涛,带领解读 Kimi K3 的技术报告。他以自己在线性注意力、混合注意力和循环增强模型方面的研究为线索,串联了多项相关工作,勾勒出一条从早期设计到 K3 的技术演进脉络。

在注意力机制上,K3 的一个核心是混合注意力设计——在保持一定比例的全注意力的同时,大量采用线性注意力以提升长上下文处理效率。孙宇涛指出,在大约 3:1(线性:全注意力)的混合下,模型既能保持甚至改善长上下文表现,又能显著提升推理效率。具体实现上,Kimi Delta Attention 将原先的标量衰减细化为 channel-wise 的衰减以提升能力上限,并通过 lower-bound 的设计兼顾 BF16 数值精度与高效的 kernel 实现;Gated MLA 则引入门控以增强训练稳定性;Attention Residuals 与 Hyper-Connections 则为残差连接带来了新的设计维度。

在模型规模与架构方面,K3 采用了 2.8T 参数的 MoE 方案。孙宇涛认为参数量仍是提升模型智力的根本因素,K3 在总体参数、激活参数和百万级上下文容量上同步扩展,体现了有效的 scaling。预训练环节涉及到 Scaling Law 指导、WSD 调度与 RNoPE 的长上下文扩展策略;Stable LatentMoE 用于降低跨设备通信开销,Quantile Balancing 用以实现专家负载均衡。优化器层面,Muon 优化器与对 outlier 的控制被强调——他认为任何优化器都会出现 outlier,严格控制往往需要从模型架构入手。 千亿球友会

后训练与部署相关的工作同样是重点:K3 采用多教师的 on-policy 蒸馏,基于学生生成样本并结合 partial rollout、reasoning-effort budget control 等类似 RL 的策略来提高蒸馏效率并控制推理成本;同时还做了面向部署的后训练和 Draft Model 微调。基础设施方面涉及到 KDA kernel、DualPipe 的通信隐藏、动态专家分配、多模态编码器优化以及推理端的缓存管理等工程细节。

在节目结尾,孙宇涛借“忒修斯之船”来讨论架构创新的边界,并给出一个颇为直白的判断:他认为大模型领域或许不会再出现极具颠覆性的单一发明,未来更多是对已有思路的集成与改良式进步。换言之,前沿模型的推进更像是行业集体贡献的积累,而商业化落地则需要对具体任务有清晰的定义。