
Kimi K3: el primer modelo open de 3T parámetros

Ilustración generada con IA como portada del post.
Moonshot AI presentó Kimi K3, su modelo más capaz hasta la fecha y el primer modelo open-weight en la categoría de 3T parámetros. Es un sparse Mixture-of-Experts de 2.8T con ventana de contexto de 1M tokens, visión nativa y dos innovaciones arquitectónicas que vale la pena mirar: Kimi Delta Attention (KDA) y Attention Residuals (AttnRes). El lanzamiento refuerza una secuencia clara — durante nueve de los últimos doce meses, modelos de Kimi han marcado el techo de tamaño open-weight.
Lo que pasó
El 16 de julio de 2026 Moonshot AI liberó Kimi K3 con disponibilidad inmediata en cuatro superficies: kimi.com, Kimi Work, Kimi Code y la API en platform.kimi.ai. Los pesos completos se publicarán el 27 de julio. El modelo corre por default con reasoning effort al máximo; las variantes low y high se introducirán en updates posteriores.
En los benchmarks propios de Moonshot, Kimi K3 queda por debajo de Claude Fable 5 y GPT 5.6 Sol en rendimiento global, pero muestra rendimiento de frontera en su suite interna y supera consistentemente a los demás modelos abiertos evaluados. La narrativa de la compañía no es “vencimos a Anthropic y OpenAI” sino “el techo open-weight subió al rango de 3T, y se puede descargar y auditar”.
Por qué importa para quien desarrolla con IA
Tres razones concretas:
1. Es el primer 3T-class open. Para quien necesita self-host, on-prem, o proveedores que no son OpenAI/Anthropic, Kimi K3 cambia la vara. Es la primera vez que un modelo de ese tamaño se puede descargar, inspeccionar, ajustar y desplegar sin pagar licencia por inferencia.
2. Es un MoE sparse extremo. Activa solo 16 de 896 experts por token (~1.8% de los parámetros). El costo de inferencia efectivo, bien afinado, se acerca al de un modelo denso mucho más chico. Eso importa cuando el cuello de botella es $/token, no disponibilidad.
3. Está pensado para sesiones largas con mínima supervisión humana. Los benchmarks y casos del blog oficial son consistentes: kernel optimization de 24h, GPU compiler from-scratch, chip design en 48h autónomo, replicación de papers de astrofísica en 2 horas. No es un chatbot; es un agente de investigación e ingeniería con timestamps largos.
Arquitectura: KDA + AttnRes + LatentMoE
Lo nuevo de Kimi K3 está en cómo fluye la información, no solo en el tamaño. Tres cambios:
- Kimi Delta Attention (KDA). Una reformulación del mecanismo de atención pensado para escalar mejor con la longitud de secuencia. KDA introduce desafíos nuevos para el prefix caching convencional; Moonshot contribuyó una implementación a vLLM que se libera junto con el modelo.
- Attention Residuals (AttnRes). En lugar de acumular representaciones de forma uniforme a través de la profundidad, AttnRes las recupera selectivamente. El resultado es que información relevante de capas tempranas puede sobrevivir hasta el final sin pagar costo uniforme en cada paso.
- Stable LatentMoE. Activa 16 de 896 experts. A ese nivel de sparsity, el routing es el problema principal. Quantile Balancing deriva la asignación de experts directamente de los cuantiles del router-score (sin hiperparámetro sensible a balancear), y Per-Head Muon extiende Muon optimizando cabezas de atención de forma independiente. SiTU (Sigmoid Tanh Unit) y Gated MLA mejoran el control de activación y la selectividad de atención.
Juntas, estas decisiones dan una mejora aproximada de 2.5× en eficiencia de escalado comparada con Kimi K2: el modelo convierte cómputo en capacidad de forma más efectiva.
Capacidades técnicas destacadas
Long-horizon coding. Kimi K3 opera con mínima supervisión humana en sesiones largas: navega repositorios masivos, orquesta herramientas de terminal y sostiene cadenas de ingeniería. En la evaluación de kernel optimization de GPU (24h en sandbox), rindió competitivo con Claude Fable 5 y superó ampliamente a Opus 4.8, GPT 5.6 Sol y GPT 5.5.
Compilador from-scratch. K3 construyó MiniTriton, un compilador Triton-like con su propia IR sobre MLIR, optimización de pases y pipeline de generación de código PTX. En benchmarks roofline, MiniTriton iguala o supera a Triton y torch.compile. Más relevante aún: sostiene entrenamiento end-to-end de nanoGPT con convergencia estable.
Chip design. Como prueba de concepto, K3 diseñó un chip para correr un nano model construido sobre su propia arquitectura. En una corrida autónoma de 48 horas, construyó, optimizó y verificó el chip usando EDA open-source sobre la librería Nangate 45nm. Cerró timing a 100 MHz en 4 mm² con 8.700 tokens/s de decode throughput. Un chip diseñado por un modelo, para un modelo.
Research computacional. En uno de los casos reportados, Kimi K3 completó en ~2 horas lo que normalmente toma 1-2 semanas a un researcher experimentado: revisó y cruzó 20+ papers, implementó el pipeline numérico completo, evaluó 300+ ecuaciones de estado, identificó inconsistencias en fórmulas publicadas, generó 3.000+ líneas de Python y produjo un dashboard HTML interactivo.
Video editing. K3 editó su propio teaser desde 56 clips fuente: selección de clip, cortes motion-matched, sincronización frame-accurate con el beat, procesamiento de audio y múltiples rondas de revisión. El output es un video de alta densidad que a un editor experimentado le tomaría 1-2 días y a un principiante 3-5.
Pricing de la API
- Cache-hit input: $0.30 / MTok
- Cache-miss input: $3.00 / MTok
- Output: $15.00 / MTok
La infraestructura de inferencia oficial usa la arquitectura disaggregada de Mooncake y logra un cache hit rate superior al 90% en workloads de coding. Es el tipo de métrica que define la economía real de un modelo en producción: no es lo mismo pagar $3/MTok con 10% cache hit que pagar $3/MTok con 90% cache hit.
El precio de cache-hit es competitivo con Anthropic y OpenAI en modelos de frontera. El precio de cache-miss está en línea. La pregunta para quien evalúa es: ¿qué porcentaje de sus workloads reales va a hit el caché? Para sesiones largas con system prompts estables, la respuesta puede ser alta.
Cuándo conviene mirar Kimi K3 vs quedarse con Claude o GPT
Considerar Kimi K3 si:
- Necesitás self-host por compliance, costo o jurisdiccional.
- Tu workload tiene system prompts largos y repetidos (alto cache hit).
- Querés auditar los pesos, fine-tunear o hacer RLHF propio.
- Hacés research o coding de horizonte largo donde la profundidad de razonamiento pesa más que la latencia de respuesta inmediata.
Quedarse con Claude Opus 5 o GPT 5.6 Sol si:
- Tu workload es corto, transaccional, con muchas requests de 1 turno.
- Dependés de integraciones nativas con herramientas de Anthropic o OpenAI (function calling, vision, etc.).
- Necesitás latencia consistente muy baja y un SLA de proveedor formal.
Diferencia con el ecosistema open previo. Kimi K3 no compite en igualdad con DeepSeek, GLM o Qwen a nivel de “modelo más capable open”; está en su propia liga de tamaño. Lo que trae a la mesa es la posibilidad concreta de self-hostear frontera sin tener que pagar $15-$75/MTok en APIs cerradas, asumiendo el costo de operar MoE a esa escala.
Lo que conviene recordar
- Kimi K3 es el primer open-weight de 3T parámetros. El techo open subió; lo que se puede hacer en infraestructura propia también.
- La arquitectura (KDA + AttnRes + LatentMoE) importa más que el conteo de parámetros. Las dos innovaciones específicas atacan problemas de escalado de atención y routing, no solo tamaño.
- Es un agente de horizonte largo, no un chatbot. Los benchmarks están elegidos para mostrar eso: kernels, compiladores, chips, papers, edición de video.
- El pricing real depende del cache hit rate. Con la arquitectura Mooncake reportando >90% en coding, el costo efectivo puede ser mejor que el número en la tabla sugiere.
- Los benchmarks son los de Moonshot. Antes de migrar producción, conviene correr la suite interna de cada organización sobre tareas reales y comparar contra el modelo anterior.
Fuente
- Kimi K3 Tech Blog: Open Frontier Intelligence — Moonshot AI, 16 de julio de 2026 (fuente principal de este post).
- Cobertura periodística complementaria: Mundiario, CNBC, MarkTechPost.
- API y pesos: platform.kimi.ai, liberación de pesos completos programada para el 27 de julio de 2026.

