Kimi K3 开放日:月之暗面把权重、技术报告和 Infra 一起开源了
资讯7 分钟阅读

Kimi K3 开放日:月之暗面把权重、技术报告和 Infra 一起开源了

Cataito Team2026-07-27

一天之内,权重、论文和工具链一起摆上桌


7 月 27 日,月之暗面给 Kimi K3 办了一场"开放日"。和以往只发个模型不同,这次他们把三样东西一次性放了出来:模型权重、完整的技术报告,以及支撑训练的关键基础设施代码。权重已经挂上了 Hugging Face,谁都能下载,开发者拿去做产品,普通用户拿去尝鲜,都在许可范围内。


在国产大模型里,肯把"家底"摊开到这个程度的并不多,所以有人半开玩笑地说月之暗面这回真成了"活雷锋"。玩笑归玩笑,真正值得看的,是他们摊开的到底是什么。


Kimi K3 是台什么样的模型


按官方给出的口径,K3 是一个混合专家(MoE)模型,参数规模大约是上一代 K2 的三倍,支持 100 万 token 的上下文,视觉理解能力也没有因为"变大"而被牺牲掉。更关键的一个数字是训练效率:官方称规模化训练的效率比上一代提升了约 2.5 倍。换句话说,同样的算力能喂出更多的模型。


对普通使用者来说,这些参数不必逐个记。记住一句就够了:更大、能看图、能一口气读完很长的材料,而且这次是开源的。


技术报告里真正的看点


比起权重,技术报告往往更能说明一家公司在想什么。K3 这份报告里,有几处设计值得拎出来讲:


  • KDA + AttnRes:他们把自研的 Kimi Delta Attention 和 Gated MLA 按 3:1 的比例混着用,目的是把长上下文的成本压下来,又不丢精度。
  • Stable LatentMoE:每个 token 会从 896 个专家里挑选路由,再配合 SiTU-GLU 和 Quantile Balancing,让这么大规模的训练还能稳得住。大模型训练最怕的就是训着训着就崩了。
  • MoonViT-V2:视觉编码器这回是从零开始、用 next-token prediction 预训练的,官方说效果比在 SigLIP 基础上初始化更好。
  • 后训练:重点押在 Agent 和编程这两块,用了数百万条数据和二十来个内部评测集反复打磨。

  • 这些名字看着唬人,落到一句话其实很朴素:他们在"长上下文更便宜""训练更稳""看图更准""更会干活"这几件事上分别下了功夫。


    更少见的是,连 Infra 也一起开源了


    大部分公司开源会止步于权重,训练用的那套"脚手架"通常捂得很紧。这次月之暗面连基础设施都放出来三件:


  • MoonEP:给超大 MoE 做 expert-parallel 通信的一套东西,让专家之间搬运数据时不至于把算力拖垮。
  • FlashKDA:Kimi Delta Attention 的高性能算子。官方给的数据是,在 H20 上比主流的 flash-linear-attention 快 1.72 到 2.22 倍,而且能直接替换着用。
  • AgentEnv:和 KVCache.ai 一起做的 Agent 训练环境,强隔离、支持并行 fork,是给 K3 后训练喂高质量数据的地方。

  • 三个仓库都挂了出来。对想训练自己模型的团队来说,这比单独一个权重文件有用得多,它把"这东西是怎么训出来的"也交代了一部分。


    为什么这件事值得记一笔


    月之暗面自己给的理由是"站在巨人的肩上":他们从开源社区拿到过东西,如今选择回馈回去。这话听着漂亮,但放到眼下的行业语境里也确实成立。DeepSeek 之后,国产模型比拼的重心正从"谁的分数高"慢慢挪向"谁更开放、谁的生态更活"。权重、论文、Infra 一起开,等于把门槛又往下压了一截,让更多人能站在同一条起跑线上往前跑。


    CATAI 的看法


    我们一直觉得,AI 导航的终点不是罗列了多少个工具,而是帮人找到那个"能把事情做成"的能力。K3 这样的开源动作,恰恰让这种能力更容易被拿到手,你不必再只依赖某一家的 API,也能把一个强模型接进自己的活里。开放越多,选择越多,这对用户永远是好事。


    ---


    关于本文:文中的参数、性能等数据来自月之暗面官方公告与公开的技术报告,我们做了梳理与解读;具体指标请以官方发布为准。

    KimiKimi K3Moonshot AIOpen SourceMoEChinese AI