El número del titular no es la historia
El 27 de julio, Moonshot AI publica los pesos completos de Kimi K3 bajo una licencia MIT modificada. La hoja de especificaciones parece un alarde: 2.8 billones de parámetros, una ventana de contexto de un millón de tokens y el título del modelo de pesos abiertos más grande jamás lanzado, aproximadamente un 75% más grande que DeepSeek V4 Pro.
Pero el tamaño es un señuelo. La verdadera historia es un cambio en quién controla el acceso a la inteligencia de nivel frontera. Durante tres años, los mejores modelos vivieron detrás de una API. Pagabas renta, el propietario establecía los términos, y si el proveedor cambiaba el precio del endpoint o modificaba silenciosamente el comportamiento del modelo, tu producto absorbía el daño.
Los pesos abiertos rompen ese arreglo. Una vez que los archivos son públicos, ningún laboratorio puede recuperar la capacidad. Ese único hecho cambia la economía para todos, incluyendo a las personas que nunca descargarán un solo fragmento.
La hoja de especificaciones de un vistazo
Especificación | Valor |
|---|---|
Parámetros | 2.8 billones |
Expertos | 896 total, 16 activos por token |
Ventana de contexto | 1,048,576 tokens |
Licencia | MIT modificada |
Lanzamiento de pesos | 27 de julio |
Tamaño vs DeepSeek V4 Pro | ~75% más grande |
Eficiencia de escalado vs K2 | ~2.5x |
Precios | Tarifa |
|---|---|
Entrada (acierto de caché) | $0.30 / 1M tokens |
Entrada (fallo de caché) | $3.00 / 1M tokens |
Salida | $15.00 / 1M tokens |
Cómo un modelo de 2.8T evita una factura de 2.8T
Un modelo denso de este tamaño sería inutilizable. Ejecutar cada parámetro en cada token es el muro contra el que todos los modelos de escala de billones chocan: demasiado lento, demasiado caro, no hay forma de evitar la física.
K3 lo evita con un diseño agresivo de Mixture of Experts. Dentro del modelo viven 896 subredes especializadas. En cualquier token dado, solo 16 de ellas se activan. Obtienes el conocimiento almacenado de 2.8 billones de parámetros mientras pagas el costo de inferencia de un modelo de una fracción de ese tamaño.
Esto es dispersión, y K3 se apoya en ella más que cualquier modelo abierto antes que él. K2 demostró que el enfoque funcionaba. K3 lo convierte en la apuesta central.

Dos artículos de investigación que hicieron el trabajo pesado
Dos cambios arquitectónicos hacen posible el resto, y ambos fueron publicados como investigación abierta antes de que el modelo se lanzara, lo que le dio a Moonshot credibilidad entre los investigadores antes de que apareciera un solo benchmark.
El primero es Kimi Delta Attention, un mecanismo de atención lineal híbrido. Los costos de atención estándar crecen cuadráticamente a medida que el contexto se alarga, por lo que las ventanas de un millón de tokens suelen quedarse en las presentaciones de marketing. KDA escala de manera diferente, y esa diferencia es la única razón por la que existe una ventana de 1M a un precio que cualquiera puede pagar.
El segundo es Attention Residuals, un reemplazo para las conexiones residuales estándar. Moonshot lo atribuye a las ganancias consistentes de escalado, permitiéndoles construir modelos más profundos sin la degradación habitual. Según sus propios números, la combinación ofrece aproximadamente 2.5 veces la eficiencia de escalado de K2.
Lo que un millón de tokens elimina

La mayor parte de la infraestructura de recuperación en la IA de producción existe como un workaround. Fragmentación, embeddings, bases de datos vectoriales, pipelines RAG: todo eso compensa a modelos que no pueden retener suficiente en la memoria de trabajo a la vez.
Un millón de tokens cambia el valor predeterminado. Una base de código completa va en un solo prompt. Un año de documentos internos. Cincuenta transcripciones de video. Todo se encuentra en la atención simultáneamente, y el modelo razona a través de todo el corpus en lugar de unir fragmentos recuperados y esperar que las costuras aguanten.
La visión nativa amplía aún más la superficie de entrada. Capturas de pantalla, fotos de pizarrón, diagramas de arquitectura y gráficos son legibles en el mismo contexto que el código y el texto que los rodea. No es casualidad que las victorias más fuertes de K3 en benchmarks hayan sido en codificación front-end: el modelo ve el diseño y escribe la implementación dentro de una ventana de contexto.
La tabla de precios que importa más que los benchmarks
Las tarifas listadas: $0.30 por millón de tokens de entrada con acierto de caché, $3.00 con fallo de caché, $15.00 por millón de tokens de salida, con un contexto de 1,048,576 tokens.
El número de caché es el que hay que mirar. Moonshot reporta tasas de acierto de caché superiores al 90% en sesiones largas de codificación. Piensa en lo que realmente hace un agente: relee el mismo repositorio una y otra vez durante horas. Sin caché, paga el precio total de entrada en cada pasada. Con ella, el costo de una sesión larga se reduce aproximadamente 4 veces.
Los agentes de horizonte largo viven o mueren exactamente con estas cuentas. K3 está construido para sesiones que duran horas con supervisión mínima, navegando un repositorio, orquestando herramientas de terminal, verificando su propio trabajo. La estructura de precios es el producto.
La advertencia que nadie debería pasar por alto
K3 no tiene modo económico. El razonamiento está permanentemente activado y fijado al máximo. Probadores independientes lo vieron quemar más de 13,000 tokens de pensamiento en una solicitud trivial de SVG, aproximadamente $0.25 por una consulta desechable.
La lección es el enrutamiento. Las llamadas rápidas, baratas y de alto volumen pertenecen a modelos más pequeños. K3 justifica su costo solo cuando el tamaño del contexto y la complejidad de la tarea justifican el razonamiento siempre activo. Usarlo como un endpoint de chat de propósito general es quemar dinero.
Conectarlo toma cinco minutos
La API es compatible con OpenAI. Cambia la base_url y la clave, mantén tu código existente:
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Introduce Kimi K3 in one sentence."}],12)13print(completion.choices[0].message.content)
El razonamiento se configura a través de un campo de nivel superior, que actualmente acepta solo 'max':
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "Prove that the square root of 2 is irrational."}],5)6print(completion.choices[0].message.content)
El streaming funciona de la manera estándar, con el razonamiento llegando en un campo delta separado para que puedas renderizar el pensamiento y la respuesta de forma independiente:
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "Explain why the sky is blue."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
La entrada de visión toma imágenes codificadas en base64 junto con texto en el mismo mensaje. Este es el flujo de trabajo de captura de pantalla a código en su totalidad:
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "Rebuild this landing page in HTML and Tailwind."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
Por qué esto llega a personas que nunca tocan los pesos
Aquí está la parte honesta: casi nadie alojará por su cuenta 2.8 billones de parámetros. Incluso con dispersión, la factura de hardware está muy lejos del alcance de los aficionados, y también más allá de la mayoría de las empresas.
Ese nunca fue el punto. Los pesos públicos ponen un techo a lo que los laboratorios cerrados pueden cobrar por una capacidad comparable. Los anfitriones de terceros competirán entre sí para servir a K3 con márgenes de commodity, la misma dinámica que se dio con cada lanzamiento abierto importante anterior. Los precios en todo el mercado se desvían hacia la línea base abierta.
El beneficio te llega a través de la factura del proveedor que ya uses, hayas descargado un archivo o no.
Un manual práctico
- Aliméntalo con cosas completas. Repositorios completos para revisión, carpetas de contratos completas, una biblioteca de contenido entera. Deja de fragmentar lo que ya no requiere fragmentación.
- Ejecútalo durante mucho tiempo. Pon en cola sesiones de ingeniería de varias horas y revisa los resultados después. El caché se come el costo de cada relectura.
- Apunta una cámara a los problemas. Toma una captura de pantalla de una página de inicio y pide la reconstrucción. Fotografía un pizarrón y pide la implementación.
- Mantén el tráfico trivial fuera de él. Un modelo que siempre razona al máximo es la herramienta equivocada para llamadas rápidas y de alto volumen. Enruta esas a otro lado y guarda K3 para el trabajo que lo merece.
La cuenta regresiva de diez días
Durante tres años, la frontera era algo que alquilabas, en términos que no establecías, a precios que podían cambiar sin previo aviso.
El 27 de julio se convierte en un archivo. Y un archivo, a diferencia de una suscripción, es algo que posees.





