Kimi K3: Guía completa de la A a la Z sobre el modelo abierto que superó a Fable 5

@kirillk_web3
INGLÉShace 2 días · 19 jul 2026
235K
78
16
13
156

TL;DR

Kimi K3 es un modelo de código abierto de 2.8 billones de parámetros de Moonshot AI que compite con modelos propietarios de primer nivel como Fable 5. Cuenta con una arquitectura innovadora para una programación de alta velocidad y contexto largo, además de capacidad de automejora autónoma.

Este es un desglose completo de la A a la Z de lo que realmente es Kimi K3, qué puede hacer y por qué se está convirtiendo silenciosamente en el modelo de codificación más importante del que nadie habla todavía.

Guarda esta página para no perder este artículo.

2.8 billones de parámetros. 1 millón de tokens de contexto.

Aquí tienes todo lo que incluye.

Antes de Hablar de Benchmarks, Hablemos de lo que Acaba de Pasar

Durante los últimos tres años la historia ha sido la misma: los laboratorios estadounidenses construyen la frontera, los laboratorios chinos construyen la copia barata seis meses después.

El 16 de julio, Moonshot AI lanzó Kimi K3.

https://x.com/Kimi_Moonshot/status/2077830229968683203

2.8 billones de parámetros totales — aproximadamente un 75% más grande que DeepSeek V4 Pro y casi 4 veces la serie GLM 5 de Zhipu. El modelo de código abierto más grande jamás lanzado.

Supera a Claude Opus 4.8. Supera a GPT-5.6 Sol. Y según los benchmarks de Moonshot, está a la par con Fable 5, el modelo más capaz disponible para el público hoy.

La historia de la copia terminó.

Los Números

Kirill - inline image

Esa última fila es la que la gente está malinterpretando. Vamos a abordarla correctamente.

La Realidad de los Precios — Léelo con Atención

Kimi K3 no es un modelo de descuento. A $3/$15 por millón de tokens, tiene un precio similar al de Claude Sonnet, no los grandes descuentos que ofrecían los lanzamientos anteriores de Moonshot.

Entonces, ¿de dónde viene lo de "5 veces más barato que Fable 5"?

Costo por tarea, no precio por token.

K3 usa sustancialmente menos tokens de salida para completar el mismo trabajo. En una tarea de codificación representativa: Fable 5 cuesta alrededor de $1.30. K3 cuesta alrededor de $0.25.

Mismo nivel de salida. Menos tokens. Factura total más baja.

El marco honesto: precio de Sonnet, experiencia de nivel Fable. No estás comprando los tokens más baratos del mercado. Estás comprando capacidad fronteriza a un precio de gama media, y llegando allí en menos pasos.

Si comparas precios de tokens en bruto, K3 parece poco notable. Si comparas lo que cuesta completar un trabajo, es una conversación completamente diferente.

Donde Kimi K3 es Estado del Arte

Según los benchmarks publicados por Moonshot, K3 establece SOTA en:

  • HLE con herramientas — El Examen Final de la Humanidad, aumentado con herramientas
  • SWE-Bench Pro — ingeniería de software del mundo real
  • SWE-Bench Multilingüe — ingeniería en múltiples idiomas
  • BrowseComp — navegación web e investigación
  • Toolathlon — uso de herramientas a escala
  • CharXiv con Python — razonamiento sobre gráficos y figuras
  • MathVision con Python — matemáticas visuales
Kirill - inline image

Frente a la competencia: supera a Opus 4.8 y GPT-5.6 Sol, a la par con Fable 5.

En pruebas ciegas realizadas por el evaluador de IA Arena, los desarrolladores prefirieron a Kimi sobre todos los modelos estadounidenses líderes.

Las Dos Innovaciones de Arquitectura que Realmente Importan

Esta es la parte que la mayoría de la cobertura está omitiendo, y es lo más interesante del lanzamiento.

Kirill - inline image
  • Atención Delta de Kimi (KDA)

Un mecanismo de atención lineal híbrido. El resultado: hasta 6.3 veces más rápido en decodificación en contextos de un millón de tokens.

Una ventana de contexto de 1M solo es útil si realmente puedes trabajar en ella sin esperar una eternidad. KDA es lo que hace que la ventana de contexto sea práctica en lugar de teórica.

  • Residuales de Atención (AttnRes)

Un reemplazo directo para las conexiones residuales. Ofrece aproximadamente un 25% más de eficiencia en el entrenamiento con menos del 2% de costo adicional.

Ambas técnicas fueron publicadas como investigación abierta por el equipo de Moonshot en GitHub antes de que el modelo se lanzara. Esto no es marketing, es trabajo que puede ser inspeccionado por pares.

Y combinadas, explican la eficiencia de tokens: K3 usa un 21% menos de tokens de salida que K2.6 en tareas equivalentes.

La Parte que Debería Hacerte Prestar Atención: K3 Optimizó su Propia Arquitectura

Moonshot le dio a K3 la implementación de Residuales de Atención (su propio componente arquitectónico) y un objetivo: hacerlo más rápido en hardware H200 sin cambiar el comportamiento numérico.

Luego lo dejaron solo.

20 horas de experimentos. Cero intervención humana. Aceleración de 1.6x.

En una ejecución separada, K3 redujo el tiempo de avance/retroceso de FLA Triton AttnRes de 283.6ms a 114.4ms, una aceleración de 2.48x, nuevamente sin cambiar los números.

Kirill - inline image

Y fue más rápido que Fable 5 haciendo la misma tarea.

Léelo de nuevo. El modelo mejoró el mecanismo que hace que el modelo funcione. Autónomamente. Durante la noche.

Esto es lo que significa "auto-mejora recursiva" en la práctica, no un escenario de ciencia ficción, sino un trabajo de 20 horas con un resultado medible. Es la misma capacidad que Anthropic señaló como motivo de cautela hace semanas, ejecutándose en un modelo de pesos abiertos que cualquiera puede descargar el 27 de julio.

La Codificación de Largo Plazo es el Punto Central

El propio marco de Moonshot: "K3 se presenta como el modelo de codificación de código abierto más potente de Moonshot AI hasta la fecha. Operando con una supervisión humana mínima, puede mantener sesiones largas de ingeniería, navegar por repositorios masivos y orquestar herramientas de terminal."

Las tres cosas que importan para el trabajo real de ingeniería:

  1. Sesiones sostenidas — el experimento autónomo de 20 horas no es una demostración. Es el objetivo de diseño.
  2. Repositorios masivos — una ventana de contexto de 1M con decodificación 6.3x más rápida significa que puedes poner un código base real en contexto y trabajar realmente en él.
  3. Orquestación de herramientas — SOTA en Toolathlon y BrowseComp significa que maneja la terminal, el navegador y las llamadas API sin desmoronarse.

La codificación de frontend se sitúa al nivel de Fable 5. Escenas de juegos de calidad AAA a partir de un solo prompt. WebGPU, Three.js, shaders, física: lo que solía requerir un estudio.

Vibe Coding con Kimi K3

Aquí es donde el modelo deja de ser un número de benchmark y comienza a ser claramente útil.

La codificación de frontend de K3 está al nivel de Fable 5. En la práctica, eso significa que la pared entre una descripción y un producto 3D funcional ahora es un solo prompt.

Lo que la gente realmente ha lanzado desde prompts individuales:

Juegos — Arenas de combate WebGPU con efectos visuales. Recorrido de ciudad 3D en navegador con mecánicas de agarre.

  1. FPS de zombis.
  2. Carreras multijugador.
  3. Un emulador de GBA 3D funcional.
  4. Andamiaje completo de MMORPG.

No es "una demo parecida a un juego": escenas jugables con reacciones a impactos, retroalimentación de impacto y física que se comporta correctamente.

Kirill - inline image

Objetos 3D con trabajo de materiales real — Un Rolex con brillo y comportamiento de luz correctos. Un arma de CSGO que se ensambla y desensambla en 33 piezas modeladas individualmente. Un despiece de una cámara Sony. Un agujero negro con lente gravitacional. Simulación de océano con dinámica de olas real.

Kirill - inline image

Escenas de física — Simulación de telas. Colapso estructural. Colisiones de vehículos con transferencia de momento que se ve correcta en lugar de parecer guionizada.

Lo que hace que esto sea diferente de las demostraciones anteriores de "IA construye un sitio web": K3 maneja los detalles que normalmente fallan. Iluminación. Sombras. Brillo de materiales. Las 20 pequeñas cosas que separan "claramente generado por IA" de "alguien construyó esto".

Un solo prompt. Cuatro millones de tokens. Una escena que solía necesitar un equipo.

4 Prompts Probados en Batalla (Listos para Copiar y Pegar)

Están estructurados para explotar lo que K3 realmente hace bien: trabajo de largo plazo, uso de herramientas y mantener un contexto grande sin desviarse.

Prompt 1 — La Prueba de Esfuerzo de Física

Este es el prompt que separa la capacidad real del pulido de demostración. Si un modelo puede hacer las tres escenas con calidad, es real.

text
1Crea tres escenas HTML5 autónomas con física real.
2Sin librerías externas. Todo en un archivo por escena.
3
4Escena 1: Un tren descarrilando de un puente roto hacia el agua.
5Incluye: momento del vagón, fallo estructural del puente,
6desplazamiento de agua en el impacto.
7
8Escena 2: Dos coches saltando desde rampas y chocando en el aire
9sobre un cañón. Incluye: arcos de trayectoria correctos,
10transferencia de momento en la colisión, escombros.
11
12Escena 3: Un monstruo truck aplastando una fila de coches aparcados.
13Incluye: compresión de suspensión, deformación de chapa metálica,
14distribución de peso.
15
16Requisitos para las tres:
17- La física debe ser calculada, no animada
18- Objetivo de 60fps
19- Incluye un botón de reinicio
20- Comenta las matemáticas de la física para que pueda verificarlas
21
22Construye las tres. No hagas preguntas aclaratorias.

Prompt 2 — La Tarea de Repositorio de Largo Plazo

Esto es para lo que realmente se construyó K3. Apúntalo a un código base real y dale un resultado, no una tarea.

text
1Lee todo este código base antes de escribir nada.
2
3[pega tu repo, o apúntalo al directorio]
4
5Objetivo: [indica un resultado medible — ej. "reducir
6el tiempo de respuesta p95 de la API en un 30%" o "eliminar
7todas las consultas N+1 en la capa de datos"]
8
9Reglas:
10- Perfila primero. Muéstrame dónde va realmente el tiempo
11 antes de cambiar nada.
12- No cambies interfaces públicas ni el comportamiento numérico.
13- Ejecuta el conjunto de pruebas existente después de cada cambio.
14- Si un cambio empeora las cosas, reviértelo y dime por qué.
15- Trabaja hasta que se alcance el objetivo o puedas demostrar que
16 no es alcanzable sin romper las reglas.
17
18Informe al final: qué cambiaste, qué ganaste,
19qué intentaste que no funcionó.

La línea de "qué intentaste que no funcionó" es importante. Es lo que convierte la salida de un diff en un registro de ingeniería.

Prompt 3 — La Construcción de Producto 3D

Para cualquiera que haga frontend, páginas de aterrizaje o visualización de productos.

text
1Construye un [objeto] 3D interactivo en el navegador.
2Un solo archivo HTML. Three.js.
3
4El objeto: [descríbelo con precisión — materiales,
5número de piezas, qué se mueve]
6
7Debe incluir:
8- Propiedades de material correctas (brillo, rugosidad,
9 metalicidad donde corresponda)
10- Iluminación de tres puntos con sombras reales
11- Controles de órbita
12- [Cualquier interacción — ensamblaje/desensamblaje, animación,
13 estados de hover]
14
15Nivel de calidad: esto debe parecer un render de producto,
16no una demo de WebGL. Si un detalle sería visible en la vida
17real, modelalo.
18
19Construye todo. Muéstrame el archivo.

La línea de "nivel de calidad" hace más trabajo que cualquier otra cosa en el prompt. K3 responde a estándares, no solo a instrucciones.

Prompt 4 — Función en Tiempo Real con una Parte Móvil

CRUD full-stack es una forma de aplicación. El tiempo real es una forma completamente diferente: el estado debe mantenerse sincronizado entre los clientes, no solo persistir en una base de datos. Aquí es donde muchos modelos fallan silenciosamente.

text
1Añade una función en tiempo real a una aplicación existente: un sistema
2de cursor colaborativo en vivo + comentarios, como el de Figma.
3
4REQUISITOS:
5- Conexión WebSocket (usa Socket.io o ws nativo)
6- Muestra las posiciones del cursor de otros usuarios conectados en tiempo real
7- Haz clic en cualquier lugar para dejar un pin de comentario
8- Los comentarios se actualizan en vivo para todos los clientes conectados
9- Maneja la desconexión/reconexión correctamente — sin cursores fantasma
10- Debounce de las actualizaciones del cursor para no saturar el socket
11
12CONSTRUYE:
131. Configura el servidor WebSocket
142. Construye la conexión del lado del cliente con reconexión automática
153. Implementa la transmisión del cursor con debouncing
164. Implementa el sistema de pines de comentarios
175. Añade un indicador de presencia simple (quién está en línea)
186. Prueba con al menos 2 clientes simulados para confirmar que la sincronización funciona
19
20Muéstrame cómo probaste la sincronización multi-cliente antes de dar esto por terminado.

Resultado esperado: Una capa en tiempo real funcional en 15–30 minutos, con evidencia visible de que se probó con más de un cliente.

Kirill - inline image

La última línea es la parte importante. Los errores en tiempo real no aparecen con una sola pestaña del navegador abierta, aparecen con dos. Un modelo que omite las pruebas multi-cliente te entregará código que parece terminado y no lo está.

Cuando K3 Falla: Guía de Solución de Problemas

Es un modelo nuevo con bordes ásperos reales. Aquí está lo que falla y qué hacer.

  • Problema: Quema tokens en tareas triviales

Este es el grande, y es estructural.

K3 actualmente viene con solo un nivel de esfuerzo de razonamiento: 'máximo'. No hay un modo de "solo responde rápido". Evaluadores independientes registraron 13,241 tokens de razonamiento para generar un SVG simple — aproximadamente $0.25 por algo que debería costar fracciones de centavo.

La solución:

no envíes trabajo simple a K3. Es un modelo fronterizo con una sola marcha, y esa marcha es "piensa mucho en todo". Usa K2.7 o un modelo más pequeño para plantillas, formato y cualquier cosa mecánica. Reserva K3 para trabajos que justifiquen el razonamiento.

Este es el error más grande que la gente cometerá en el primer mes: hacer de K3 el predeterminado para todo y luego sorprenderse con la factura.

  • Problema: La ventana de contexto se llena de todas formas

1M de tokens suena infinito hasta que pones un repo real y no lo es.

La solución:

no vuelques todo. Apúntalo a los directorios que importan. La fortaleza de K3 en trabajos de largo plazo proviene de la concentración sostenida, no de tener todos los archivos en contexto. Unos 200K ajustados del código correcto superan a unos 900K inflados de todo el monorepo.

  • Problema: Se desvía en ejecuciones autónomas muy largas

El experimento autónomo de 20 horas es real, pero funcionó porque el objetivo era medible — "haz esto más rápido en H200 sin cambiar los números". Dale un objetivo vago y una larga correa y se desviará.

La solución:

cada prompt de largo plazo necesita una condición de éxito verificable. No "mejora el código". Un número, una prueba que pase, un benchmark que se mueva. Si no puedes decir cómo comprobarías si tuvo éxito, se desviará.

  • Problema: No puedes reproducir el resultado de benchmark de alguien

Nadie fuera de Moonshot ha auditado este modelo. Los pesos no se publican hasta el 27 de julio. Cada número que circula ahora, incluyendo en este artículo, es reportado por el proveedor.

La solución:

espera al 27 de julio, o prueba en tus propias tareas y confía en eso. Tus cinco tareas reales valen más que la tabla de benchmarks de cualquiera.

  • Problema: Errores de integración después de cambiar de OpenAI o Anthropic

K3 es compatible con el SDK de OpenAI, lo que cubre el 90% de la migración. El 10% restante suele ser el comportamiento de razonamiento: K3 piensa por defecto y devuelve tokens de razonamiento que quizás no esperes en el manejo de tu respuesta.

La solución:

revisa tu contabilidad de tokens y tu análisis de respuesta antes de asumir que el modelo está roto. La mayoría de las quejas de "K3 es caro" son en realidad "olvidé que los tokens de razonamiento son tokens de salida".

El Contexto que Nadie Debería Ignorar

Moonshot tiene su sede en Pekín, fundada por Yang Zhilin, ex investigador de Google, y respaldada por Alibaba.

https://x.com/kirillk_web3/status/2057528102368977328

Construyeron un modelo fronterizo de 2.8 billones de parámetros bajo tres años de crecientes controles de exportación de EE. UU. sobre chips avanzados.

Los analistas de Bank of America lo dijeron directamente: "A pesar de las persistentes limitaciones de hardware/capacidad de cómputo en China, K3 demuestra que el escalado del pre-entrenamiento, junto con la innovación arquitectónica, aún puede ofrecer mejoras radicales para los modelos chinos emblemáticos."

Y el momento no es accidental: K3 aterrizó días antes de la Conferencia Mundial de Inteligencia Artificial de 2026 en Shanghái.

La Pregunta del 27 de Julio

Los pesos se publican el 27 de julio. Esa fecha importa más que la fecha de lanzamiento.

Hasta entonces, K3 es un modelo fronterizo que puedes usar a través de una API — impresionante.

El 27 de julio, se convierte en otra cosa: un modelo de clase fronteriza que cualquiera puede descargar, inspeccionar, modificar y ejecutar en su propio hardware. Sin API. Sin límites de uso. Sin términos de servicio. Sin retención de prompts de 30 días.

Esa es la historia real. No "China se puso al día".

China se puso al día y lo regaló.

Kirill - inline image

Vale la pena señalar: los reguladores chinos han estado discutiendo controles de exportación de IA propios. No está claro si K3 es el último lanzamiento de pesos abiertos fronterizos de China o el primero de muchos.

Cómo Probarlo

Chat: kimi.com — K3 está activo ahora

API: Compatible con el SDK de OpenAI, así que si ya estás construyendo en cadenas de herramientas de OpenAI o Anthropic, la integración es un cambio de configuración, no una reescritura

Pesos: 27 de julio

La compatibilidad con el SDK es más importante de lo que parece. Cambiar de modelo normalmente significa reescribir tu capa de integración. Aquí significa cambiar una URL base y una cadena de modelo.

Cómo Instalar Kimi Code (El Agente de Terminal)

Si quieres que K3 se ejecute dentro de tu código base real en lugar de una ventana de chat, esta es la configuración.

Kirill - inline image

Requisitos:

  • Una computadora (Mac, Windows o Linux)
  • Acceso a terminal
  • Cuenta de Kimi — kimi.com

Paso 1 — Instalar Kimi Code

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

En Windows, instala Git for Windows primero — la CLI de Kimi Code usa su Git Bash integrado como entorno de shell.

Verifica la instalación:

bash
1kimi --version

Debido a Gatekeeper de macOS, la primera ejecución puede tardar notablemente más. Añade tu aplicación de terminal en Configuración del Sistema → Privacidad y Seguridad → Herramientas de Desarrollador para acelerar los lanzamientos posteriores.

Si ya tienes uv instalado, puedes instalar directamente:

bash
1uv tool install --python 3.13 kimi-cli

La CLI de Kimi Code es compatible con Python 3.12–3.14, recomendándose 3.13 para la mejor compatibilidad.

Paso 2 — Navega a tu proyecto e inicia

bash
1cd tu-proyecto
2kimi

En el primer inicio, ejecuta /login dentro de la sesión para configurar tu fuente de API — se abre una ventana del navegador para OAuth.

Paso 3 — Dale una tarea

Kimi Code ahora se ejecuta dentro de tu proyecto, con acceso de lectura/escritura directo a cada archivo. Describe una tarea en español simple — planea los pasos, edita el código, ejecuta pruebas e informa lo que hizo.

Lo que Esto Realmente Significa

Si estás ejecutando cargas de trabajo de producción:

Pruébalo antes de cambiar. Los benchmarks de los proveedores y el rendimiento del mundo real divergen constantemente. Elige cinco tareas reales, ejecuta K3 y tu modelo actual uno al lado del otro, mide el costo por trabajo completado, no el costo por token.

Kirill - inline image

El cálculo por tarea es todo el argumento. A $3/$15, K3 no es barato en papel. Con un 21% menos de tokens y resultados a nivel de Fable, es barato donde importa.

El 27 de julio cambia las reglas del juego. Los pesos abiertos significan auto-hosting, fine-tuning y dependencia cero de que la API de alguien siga en línea o de que los términos de alguien sigan siendo favorables. Para cualquier cosa sensible, eso no es poca cosa.

Conclusión

La frontera solía ser un lugar que los laboratorios estadounidenses construían y todos los demás visitaban seis meses después.

2.8 billones de parámetros. 1M de contexto. Codificación a nivel de Fable 5 a precio de Sonnet. Construido bajo controles de exportación, por el laboratorio con la valoración más baja de la sala, y regalado el 27 de julio.

La pregunta interesante no es si K3 supera a Fable 5 en algún benchmark. Es qué sucede con la economía de los modelos fronterizos cerrados cuando uno de pesos abiertos los iguala.

Enlaces

Sigue para más información sobre Vibe Coding. ¡Gracias por leer!

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales