Día de apertura de Kimi K3: Moonshot AI pone sobre la mesa los pesos, el informe técnico y su infraestructura
Noticias7 min de lectura

Día de apertura de Kimi K3: Moonshot AI pone sobre la mesa los pesos, el informe técnico y su infraestructura

Cataito Team2026-07-27

Todo a la vez: pesos, informe y cadena de herramientas


El 27 de julio, Moonshot AI celebró un «día de apertura» para Kimi K3. En lugar de soltar un modelo sin más, el equipo publicó tres cosas al mismo tiempo: los pesos del modelo, un informe técnico completo y el código de la infraestructura clave usada para entrenarlo. Los pesos ya están en Hugging Face, listos para descargar: los desarrolladores pueden construir sobre ellos y los usuarios curiosos pueden trastear, todo dentro de la licencia.


No son muchos los laboratorios chinos que enseñan tanto de su cocina, y por eso algunos bromearon con que Moonshot se había vuelto un santo. Bromas aparte, lo interesante es qué abrieron exactamente.


Qué clase de modelo es K3


Según la propia Moonshot, K3 es un modelo de Mezcla de Expertos (MoE), unas tres veces mayor que el anterior K2, con una ventana de contexto de un millón de tokens y una comprensión visual que no se sacrificó por el tamaño. La cifra a destacar es la eficiencia de entrenamiento: la empresa afirma que el entrenamiento a gran escala es unas 2,5 veces más eficiente que en la generación anterior, es decir, la misma computación rinde más modelo.


No hace falta memorizar las especificaciones. Una frase basta: más grande, capaz de ver imágenes, capaz de leer documentos larguísimos de una sola vez y, esta vez, de código abierto.


Lo que de verdad merece leerse en el informe


Un informe técnico suele decir más sobre el pensamiento de una empresa que los propios pesos. En el de K3 destacan varias decisiones de diseño:


  • KDA + AttnRes: mezclan su propio Kimi Delta Attention con Gated MLA en una proporción de 3:1, para recortar el coste del contexto largo sin renunciar a la precisión.
  • Stable LatentMoE: cada token se enruta entre 896 expertos y, con SiTU-GLU y Quantile Balancing, el entrenamiento se mantiene estable a esa escala; la inestabilidad es lo que arruina los grandes entrenamientos.
  • MoonViT-V2: el codificador visual se preentrenó desde cero con next-token prediction, que según el equipo supera a inicializar desde SigLIP.
  • Postentrenamiento: el foco está en los agentes y la programación, pulido con millones de muestras y una veintena de conjuntos de evaluación internos.

  • Los nombres imponen; la idea es sencilla. Trabajaron en cuatro cosas: contexto largo más barato, entrenamiento más estable, visión más afinada y hacer más cosas.


    El gesto más raro: abrir también la infraestructura


    La mayoría de las empresas se detienen en los pesos y guardan bajo llave el andamiaje del entrenamiento. Esta vez Moonshot liberó también tres piezas de infraestructura:


  • MoonEP: comunicación expert-parallel para modelos MoE muy grandes, para que mover datos entre expertos no lastre la computación.
  • FlashKDA: un kernel de alto rendimiento para Kimi Delta Attention. Las cifras de Moonshot lo sitúan entre 1,72 y 2,22 veces más rápido que el flash-linear-attention habitual en la H20, y sirve como reemplazo directo.
  • AgentEnv: un entorno de entrenamiento de agentes creado con KVCache.ai, fuertemente aislado, con soporte para forks en paralelo, y donde el postentrenamiento de K3 obtiene sus datos de calidad.

  • Los tres repositorios están publicados. Para cualquier equipo que intente entrenar su propio modelo, eso es mucho más útil que un archivo de pesos suelto: explica parte de cómo se hizo realmente.


    Por qué merece una nota


    La razón que da Moonshot es «subirse a hombros de gigantes»: tomaron de la comunidad de código abierto y ahora eligen devolver. Suena bien, pero también se sostiene en el contexto actual: tras DeepSeek, la competencia entre los modelos chinos se desplaza de «quién puntúa más alto» hacia «quién es más abierto, quién tiene el ecosistema más vivo». Publicar pesos, informe e infraestructura a la vez baja otro peldaño el listón y deja que más gente arranque desde la misma línea.


    La visión de CATAI


    Siempre hemos pensado que el destino de la navegación por IA no es cuántas herramientas puedes enumerar, sino ayudar a la gente a encontrar la capacidad que resuelve la tarea. Un movimiento como el de K3 pone esa capacidad más al alcance: ya no hace falta depender de la API de un único proveedor para integrar un modelo potente en tu propio trabajo. Más apertura significa más opciones, y eso siempre es una buena noticia para los usuarios.


    ---


    Sobre este artículo: las cifras de parámetros y rendimiento proceden del anuncio oficial de Moonshot AI y del informe técnico publicado, que hemos resumido e interpretado; para los datos exactos, consulta la publicación oficial.

    KimiKimi K3Moonshot AIOpen SourceMoEChinese AI