Kimi K3: Guía completa de la A a la Z sobre el modelo abierto que superó a Fable 5

@kirillk_web3
INGLÉShace 2 días · 19 jul 2026
235K
78
16
13
156

TL;DR

Kimi K3 es un modelo de código abierto de 2.8 billones de parámetros de Moonshot AI que compite con modelos propietarios de primer nivel como Fable 5. Cuenta con una arquitectura innovadora para la programación de alta velocidad con contexto largo y capacidad de automejora autónoma.

Esta es una guía completa de la A a la Z sobre qué es realmente Kimi K3, qué puede hacer y por qué se está convirtiendo silenciosamente en el modelo de codificación más importante del que nadie habla todavía.

Guarda esta página para no perder este artículo.

2.8 billones de parámetros. Un contexto de 1 millón de tokens.

Aquí tienes todo lo que incluye.

Antes de hablar de benchmarks, hablemos de lo que acaba de pasar

Durante los últimos tres años, la historia ha sido la misma: los laboratorios estadounidenses construyen la frontera, los laboratorios chinos construyen la copia barata seis meses después.

El 16 de julio, Moonshot AI lanzó Kimi K3.

https://x.com/Kimi_Moonshot/status/2077830229968683203

2.8 billones de parámetros totales — aproximadamente un 75 % más grande que DeepSeek V4 Pro y casi 4 veces más que la serie GLM 5 de Zhipu. El modelo de código abierto más grande jamás lanzado.

Supera a Claude Opus 4.8. Supera a GPT-5.6 Sol. Y en los benchmarks de Moonshot, está a la par de Fable 5, el modelo más capaz disponible para el público hoy en día.

La historia de la copia ha terminado.

Los números

Kirill - inline image

Esa última fila es la que la gente está malinterpretando. Abordémosla correctamente.

La realidad de los precios: léelo con atención

Kimi K3 no es un modelo de descuento. A $3/$15 por millón de tokens, tiene un precio similar al de Claude Sonnet, no los profundos descuentos que ofrecían los lanzamientos anteriores de Moonshot.

Entonces, ¿de dónde viene eso de "5 veces más barato que Fable 5"?

Costo por tarea, no precio por token.

K3 utiliza sustancialmente menos tokens de salida para completar el mismo trabajo. En una tarea de codificación representativa: Fable 5 cuesta alrededor de $1.30. K3 cuesta alrededor de $0.25.

Mismo nivel de salida. Menos tokens. Factura total más baja.

El marco honesto: Precio de Sonnet, experiencia de nivel Fable. No estás comprando los tokens más baratos del mercado. Estás comprando capacidad de frontera a un precio de gama media, y llegando allí en menos pasos.

Si comparas precios de tokens en bruto, K3 parece mediocre. Si comparas lo que cuesta completar un trabajo, es una conversación completamente diferente.

Dónde Kimi K3 es estado del arte

Según los benchmarks publicados por Moonshot, K3 establece SOTA en:

  • HLE con herramientas — El examen final de la humanidad, aumentado con herramientas
  • SWE-Bench Pro — ingeniería de software del mundo real
  • SWE-Bench Multilingüe — ingeniería en varios idiomas
  • BrowseComp — navegación web e investigación
  • Toolathlon — uso de herramientas a escala
  • CharXiv con Python — razonamiento sobre gráficos y figuras
  • MathVision con Python — matemáticas visuales
Kirill - inline image

Frente a la competencia: supera a Opus 4.8 y GPT-5.6 Sol, a la par de Fable 5.

En pruebas ciegas realizadas por el evaluador de IA Arena, los desarrolladores prefirieron a Kimi sobre todos los modelos estadounidenses líderes.

Las dos innovaciones de arquitectura que realmente importan

Esta es la parte que la mayoría de la cobertura está omitiendo, y es lo más interesante del lanzamiento.

Kirill - inline image
  • Kimi Delta Attention (KDA)

Un mecanismo de atención lineal híbrido. El resultado: hasta 6.3 veces más rápido en decodificación en contextos de un millón de tokens.

Una ventana de contexto de 1M solo es útil si puedes trabajar realmente en ella sin esperar eternamente. KDA es lo que hace que la ventana de contexto sea práctica en lugar de teórica.

  • Residuos de Atención (AttnRes)

Un reemplazo directo para las conexiones residuales. Ofrece aproximadamente un 25% más de eficiencia de entrenamiento con un costo adicional inferior al 2%.

Ambas técnicas fueron publicadas como investigación abierta por el equipo de Moonshot en GitHub antes de que el modelo se enviara. Esto no es marketing, es un trabajo que puede ser inspeccionado por pares.

Y combinadas, explican la eficiencia de tokens: K3 utiliza un 21% menos de tokens de salida que K2.6 en tareas equivalentes.

La parte que debería hacerte prestar atención: K3 optimizó su propia arquitectura

Moonshot le dio a K3 la implementación de Attention Residuals (su propio componente arquitectónico) y un objetivo: hacerlo más rápido en hardware H200 sin cambiar el comportamiento numérico.

Luego lo dejaron solo.

20 horas de experimentos. Cero intervención humana. Aceleración de 1.6x.

En una ejecución separada, K3 redujo el tiempo de avance/retroceso de FLA Triton AttnRes de 283.6 ms a 114.4 ms, una aceleración de 2.48x — nuevamente sin cambiar los números.

Kirill - inline image

Y mejoró más rápido que Fable 5 haciendo la misma tarea.

Léelo de nuevo. El modelo mejoró el mecanismo que hace que el modelo funcione. Autónomamente. Durante la noche.

Esto es lo que parece la "automejora recursiva" en la práctica — no un escenario de ciencia ficción, sino un trabajo de 20 horas con un resultado medible. Es la misma capacidad que Anthropic señaló como motivo de precaución hace semanas, ejecutándose en un modelo de pesos abiertos que cualquiera puede descargar el 27 de julio.

La codificación de largo horizonte es el objetivo principal

El propio marco de Moonshot: "K3 se presenta como el modelo de codificación de código abierto más potente de Moonshot AI hasta la fecha. Operando con una supervisión humana mínima, puede mantener sesiones de ingeniería largas, navegar por repositorios masivos y orquestar herramientas de terminal."

Las tres cosas que importan para el trabajo de ingeniería real:

  1. Sesiones sostenidas — el experimento autónomo de 20 horas no es una demostración. Es el objetivo de diseño.
  2. Repositorios masivos — una ventana de contexto de 1M con decodificación 6.3x más rápida significa que puedes poner un código base real en contexto y trabajar realmente en él.
  3. Orquestación de herramientas — SOTA en Toolathlon y BrowseComp significa que maneja la terminal, el navegador y las llamadas API sin desmoronarse.

La codificación de frontend alcanza el nivel de Fable 5. Escenas de juegos de calidad AAA a partir de un solo prompt. WebGPU, Three.js, shaders, física — lo que solía requerir un estudio.

Vibe Coding con Kimi K3

Aquí es donde el modelo deja de ser un número de benchmark y empieza a ser claramente útil.

La codificación de frontend de K3 está al nivel de Fable 5. En la práctica, eso significa que la pared entre una descripción y un producto 3D funcional es ahora un solo prompt.

Lo que la gente ha lanzado realmente a partir de prompts individuales:

Juegos — Arenas de combate WebGPU con efectos visuales. Recorrido 3D en el navegador por una ciudad con mecánicas de agarre.

  1. Zombie FPS.
  2. Carreras multijugador.
  3. Un emulador de GBA 3D funcional.
  4. Andamio completo de MMORPG.

No es una "demo parecida a un juego" — son escenas jugables con reacciones a impactos, retroalimentación de golpes y física que se comporta correctamente.

Kirill - inline image

Objetos 3D con trabajo de materiales reales — Un Rolex con brillo y comportamiento de luz correctos. Un arma de CSGO que se ensambla y desensambla en 33 piezas modeladas individualmente. Un despiece de una cámara Sony. Un agujero negro con lente gravitacional. Simulación oceánica con dinámica de olas real.

Kirill - inline image

Escenas de física — Simulación de telas. Colapso estructural. Colisiones de vehículos con transferencia de momento que se ve correcta, no como si estuviera guionizada.

Lo que hace que esto sea diferente de las demostraciones anteriores de "IA construye un sitio web": K3 maneja los detalles que normalmente fallan. Iluminación. Sombras. Brillo de materiales. Las 20 pequeñas cosas que separan "claramente generado por IA" de "alguien construyó esto".

Un solo prompt. Cuatro millones de tokens. Una escena que solía necesitar un equipo.

4 Prompts probados en batalla (listos para copiar y pegar)

Están estructurados para explotar lo que K3 realmente sabe hacer: trabajo de largo horizonte, uso de herramientas y mantener un contexto grande sin desviarse.

Prompt 1 — La prueba de estrés de física

Este es el prompt que separa la capacidad real de la demo pulida. Si un modelo puede hacer las tres escenas con calidad, es real.

text
1Construye tres escenas autónomas en canvas HTML5 con física real.
2Sin librerías externas. Todo en un solo archivo por escena.
3
4Escena 1: Un tren descarrilando desde un puente roto hacia el agua.
5Incluye: momento de los vagones, fallo estructural del puente,
6desplazamiento del agua al impactar.
7
8Escena 2: Dos coches saltando desde rampas y colisionando en el aire
9sobre un cañón. Incluye: trayectorias correctas,
10transferencia de momento en la colisión, escombros.
11
12Escena 3: Un monster truck aplastando una fila de coches aparcados.
13Incluye: compresión de la suspensión, deformación de la chapa,
14distribución del peso.
15
16Requisitos para las tres:
17- La física debe ser calculada, no animada
18- Objetivo de 60fps
19- Incluye un botón de reinicio
20- Comenta las matemáticas de la física para que pueda verificarlas
21
22Construye las tres. No hagas preguntas aclaratorias.

Prompt 2 — La tarea de repositorio de largo horizonte

Esto es para lo que realmente se construyó K3. Apúntalo a un código base real y dale un resultado, no una tarea.

text
1Lee todo este código base antes de escribir nada.
2
3[Pega tu repositorio, o apúntalo al directorio]
4
5Objetivo: [indica un resultado medible — ej. "reducir el tiempo de
6respuesta p95 de la API en un 30%" o "eliminar todas las consultas N+1
7en la capa de datos"]
8
9Reglas:
10- Perfila primero. Muéstrame dónde va realmente el tiempo
11 antes de cambiar nada.
12- No cambies interfaces públicas ni comportamiento numérico.
13- Ejecuta el conjunto de pruebas existente después de cada cambio.
14- Si un cambio empeora las cosas, reviértelo y dime por qué.
15- Trabaja hasta alcanzar el objetivo o puedas demostrar que
16 no es alcanzable sin romper las reglas.
17
18Informa al final: qué cambiaste, qué aportó,
19qué intentaste que no funcionó.

La línea "qué intentaste que no funcionó" es importante. Es lo que convierte la salida de un diff en un registro de ingeniería.

Prompt 3 — La construcción de producto 3D

Para cualquiera que haga frontend, páginas de aterrizaje o visualización de productos.

text
1Construye un [objeto] 3D interactivo en el navegador.
2Un solo archivo HTML. Three.js.
3
4El objeto: [descríbelo con precisión — materiales,
5número de piezas, qué se mueve]
6
7Debe incluir:
8- Propiedades de material correctas (brillo, rugosidad,
9 metalicidad cuando corresponda)
10- Iluminación de tres puntos con sombras reales
11- Controles de órbita
12- [Cualquier interacción — ensamblaje/desensamblaje, animación,
13 estados de hover]
14
15Estándar de calidad: esto debe parecer un render de producto,
16no una demo de WebGL. Si un detalle sería visible en la vida real,
17módelo.
18
19Construye todo. Muéstrame el archivo.

La línea "estándar de calidad" hace más trabajo que cualquier otra cosa en el prompt. K3 responde a estándares, no solo a instrucciones.

Prompt 4 — Funcionalidad en tiempo real con una parte móvil

CRUD completo es una forma de aplicación. El tiempo real es una forma completamente diferente: el estado debe mantenerse sincronizado entre clientes, no solo persistir en una base de datos. Aquí es donde muchos modelos fallan silenciosamente.

text
1Añade una funcionalidad en tiempo real a una aplicación existente: un sistema
2de cursor colaborativo en vivo + comentarios, como el de Figma.
3
4REQUISITOS:
5- Conexión WebSocket (usa Socket.io o ws nativo)
6- Muestra las posiciones del cursor de otros usuarios conectados en tiempo real
7- Haz clic en cualquier lugar para soltar un pin de comentario
8- Los comentarios se actualizan en vivo para todos los clientes conectados
9- Maneja desconexión/reconexión con elegancia — sin cursores fantasma
10- Debouncea las actualizaciones del cursor para que no inunden el socket
11
12CONSTRUYE:
131. Configura el servidor WebSocket
142. Construye la conexión del lado del cliente con reconexión automática
153. Implementa la transmisión del cursor con debouncing
164. Implementa el sistema de pines de comentarios
175. Añade un indicador de presencia simple (quién está en línea)
186. Prueba con al menos 2 clientes simulados para confirmar la sincronización
19
20Muéstrame cómo probaste la sincronización multi-cliente antes de dar esto por terminado.

Resultado esperado: Una capa en tiempo real funcional en 15–30 minutos, con evidencia visible de que se probó con más de un cliente.

Kirill - inline image

La última línea es la parte importante. Los errores en tiempo real no aparecen con una sola pestaña del navegador, aparecen con dos. Un modelo que omite las pruebas con múltiples clientes te dará código que parece terminado pero no lo está.

Cuando K3 falla: guía de solución de problemas

Es un modelo nuevo con bordes ásperos reales. Aquí está lo que falla y qué hacer.

  • Problema: Quema tokens en tareas triviales

Este es el grande, y es estructural.

K3 actualmente solo viene con un nivel de esfuerzo de razonamiento: 'max'. No hay un modo de "solo responder rápido". Evaluadores independientes midieron 13,241 tokens de razonamiento para generar un SVG simple — aproximadamente $0.25 por algo que debería costar fracciones de un centavo.

La solución:

no envíes trabajo simple a K3. Es un modelo de frontera con una sola marcha, y esa marcha es "piensa mucho en todo". Usa K2.7 o un modelo más pequeño para boilerplate, formato y cualquier cosa mecánica. Reserva K3 para el trabajo que justifique el razonamiento.

Este es el error más grande que la gente cometerá en el primer mes: hacer de K3 el predeterminado para todo y luego sorprenderse con la factura.

  • Problema: La ventana de contexto se llena de todas formas

1M de tokens suena infinito hasta que pones un repositorio real y no lo es.

La solución:

no lo vuelques todo. Apúntalo a los directorios que importan. La fortaleza de K3 en trabajos de largo horizonte proviene de la atención sostenida, no de tener todos los archivos en contexto. Un ajustado 200K del código correcto supera a un inflado 900K de todo el monorepo.

  • Problema: Se desvía en ejecuciones autónomas muy largas

El experimento autónomo de 20 horas es real, pero funcionó porque el objetivo era medible — "haz esto más rápido en H200 sin cambiar los números". Dale un objetivo vago y una correa larga y divagará.

La solución:

cada prompt de largo horizonte necesita una condición de éxito verificable. No es "mejora el código". Un número, una prueba que pase, un benchmark que se mueva. Si no puedes indicar cómo comprobarías si tuvo éxito, se desviará.

  • Problema: No puedes reproducir el resultado de un benchmark de alguien

Nadie fuera de Moonshot ha auditado este modelo. Los pesos no se publican hasta el 27 de julio. Cada número que circula ahora — incluyendo los de este artículo — son reportados por el proveedor.

La solución:

espera al 27 de julio, o prueba en tus propias tareas y confía en eso. Tus cinco tareas reales valen más que cualquier tabla de benchmarks de alguien.

  • Problema: Errores de integración después de cambiar de OpenAI o Anthropic

K3 es compatible con el SDK de OpenAI, lo que cubre el 90% de la migración. El 10% restante suele ser el comportamiento de razonamiento: K3 piensa por defecto y devuelve tokens de razonamiento que quizás no esperes en el manejo de tu respuesta.

La solución:

revisa tu contabilidad de tokens y el análisis de tu respuesta antes de asumir que el modelo está roto. La mayoría de las quejas de "K3 es caro" son en realidad "olvidé que los tokens de razonamiento son tokens de salida".

El contexto que nadie debería ignorar

Moonshot tiene su sede en Pekín, fundada por Yang Zhilin, ex investigador de Google, y respaldada por Alibaba.

https://x.com/kirillk_web3/status/2057528102368977328

Construyeron un modelo de frontera de 2.8 billones de parámetros bajo tres años de crecientes controles de exportación de Estados Unidos sobre chips avanzados.

Los analistas de Bank of America lo dijeron directamente: "A pesar de las persistentes restricciones de capacidad de hardware/computación en China, K3 demuestra que el escalado del preentrenamiento, junto con la innovación arquitectónica, aún puede ofrecer mejoras transformadoras para los modelos chinos emblemáticos".

Y el momento no es accidental: K3 llegó días antes de la Conferencia Mundial de Inteligencia Artificial de 2026 en Shanghái.

La pregunta del 27 de julio

Los pesos se publican el 27 de julio. Esa fecha importa más que la fecha de lanzamiento.

Hasta entonces, K3 es un modelo de frontera que puedes usar a través de una API — impresionante.

El 27 de julio, se convierte en otra cosa: un modelo de clase fronteriza que cualquiera puede descargar, inspeccionar, modificar y ejecutar en su propio hardware. Sin API. Sin límites de uso. Sin términos de servicio. Sin retención de prompts de 30 días.

Esa es la verdadera historia. No es "China se puso al día".

China se puso al día y lo regaló.

Kirill - inline image

Vale la pena señalar: los reguladores chinos han estado discutiendo sus propios controles de exportación de IA. No está claro si K3 es la última versión de pesos abiertos de frontera de China o la primera de muchas.

Cómo probarlo

Chat: kimi.com — K3 está activo ahora

API: Compatible con el SDK de OpenAI, así que si ya estás construyendo con cadenas de herramientas de OpenAI o Anthropic, la integración es un cambio de configuración, no una reescritura

Pesos: 27 de julio

La compatibilidad con el SDK es más importante de lo que parece. Cambiar de modelos normalmente significa reescribir tu capa de integración. Aquí significa cambiar una URL base y una cadena de modelo.

Cómo instalar Kimi Code (el agente de terminal)

Si quieres que K3 funcione dentro de tu código base real en lugar de una ventana de chat, esta es la configuración.

Kirill - inline image

Requisitos:

  • Un ordenador (Mac, Windows o Linux)
  • Acceso a terminal
  • Cuenta de Kimi — kimi.com

Paso 1 — Instalar Kimi Code

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

En Windows, instala Git for Windows primero — la CLI de Kimi Code usa su Git Bash incluido como entorno de shell.

Verifica la instalación:

bash
1kimi --version

Debido a Gatekeeper de macOS, la primera ejecución puede tardar notablemente más. Añade tu aplicación de terminal en Ajustes del Sistema → Privacidad y Seguridad → Herramientas de Desarrollo para acelerar los lanzamientos posteriores.

Si ya tienes uv instalado, puedes instalarlo directamente:

bash
1uv tool install --python 3.13 kimi-cli

La CLI de Kimi Code es compatible con Python 3.12–3.14, recomendándose 3.13 para una mejor compatibilidad.

Paso 2 — Navega a tu proyecto y ejecuta

bash
1cd tu-proyecto
2kimi

En el primer inicio, ejecuta /login dentro de la sesión para configurar tu fuente de API — se abre una ventana del navegador para OAuth.

Paso 3 — Dale una tarea

Kimi Code ahora se ejecuta dentro de tu proyecto, con acceso directo de lectura/escritura a todos los archivos. Describe una tarea en inglés simple — planifica los pasos, edita el código, ejecuta pruebas e informa lo que hizo.

Lo que esto realmente significa

Si estás ejecutando cargas de trabajo de producción:

Pruébalo antes de cambiar. Los benchmarks de los proveedores y el rendimiento del mundo real divergen constantemente. Elige cinco tareas reales, ejecuta K3 y tu modelo actual lado a lado, mide el costo por trabajo completado — no el costo por token.

Kirill - inline image

La matemática por tarea es todo el argumento. A $3/$15, K3 no es barato sobre el papel. Con un 21% menos de tokens y salida de nivel Fable, es barato donde importa.

El 27 de julio cambia el cálculo. Los pesos abiertos significan autoalojamiento, ajuste fino y cero dependencia de que la API de alguien se mantenga en línea o de que los términos de alguien sigan siendo favorables. Para cualquier cosa sensible, eso no es poca cosa.

Conclusión

La frontera solía ser un lugar que los laboratorios estadounidenses construían y todos los demás visitaban seis meses después.

2.8 billones de parámetros. 1M de contexto. Codificación de nivel Fable 5 a precio de Sonnet. Construido bajo controles de exportación, por el laboratorio con la valoración más baja de la sala, y regalado el 27 de julio.

La pregunta interesante no es si K3 supera a Fable 5 en algún benchmark. Es qué sucede con la economía de los modelos cerrados de frontera cuando uno de pesos abiertos los iguala.

Enlaces

Sígueme para más información sobre Vibe Coding. ¡Gracias por leer!

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales