Kimi K3 架构拆解:2.8T 开源权重真正值钱的是推理效率设计
我不太建议把 Kimi K3 简单理解成“又一个开源大模型”。 真正有意思的地方不是 2.8T 这个数字有多吓人,而是 Moonshot AI 把一套越来越接近生产级 frontier 模型的效率设计摊开了:Kimi Delta Attention、Gated MLA、Attention Residuals、LatentMoE、MXFP4 权重量化、MXFP8 激活量化、1M token 上下文、原生多模态。单独看每个词都像论文标题,合在一起才是重点——大模型下一阶段的竞争,越来越像系统工程,而不是单纯堆参数。 这也是 Hacker News 上 Kimi K3 Architecture Overview and Notes 这条讨论值得看的原因。原帖链接到 Sebastian Raschka 的 Kimi K3 Architecture Notes,他把 K3 的架构画成了一张很直观的图:这不是传统 Transformer 放大版,而是一堆围绕“让超大模型能被训练和推理”的组件组合。 说白了,Kimi K3 的核心问题不是“2.8T 参数模型有没有意义”,而是:一个 3T 级别开源权重模型,能不能用架构和数值格式把推理成本压到工程上还能讨论的范围内? 2.8T 总参数,104B 激活参数:MoE 的账要这么算 先看官方仓库。Moonshot AI 的 Kimi-K3 README 写得很明确:Kimi K3 是 open-weight、native multimodal、agentic model,总参数 2.8T,激活参数 104B,93 层,896 个专家,每个 token 选择 16 个专家,支持 1,048,576 token 上下文。GitHub 仓库不是空壳,截至本次写作 API 返回约 3.4k stars,最近 push 在 2026-07-28,并公开了 README、LICENSE 和完整技术报告 PDF。 ...