Kimi K3 se lanzó el 16 de julio de 2026. 2,8 billones de parámetros. 1 millón de tokens de contexto. El modelo de pesos abiertos más grande jamás publicado.
La función estrella es K3 Swarm Max: hasta 300 subagentes ejecutándose en paralelo, coordinándose en más de 4000 pasos, produciendo archivos reales en lugar de respuestas de chat. Dos variantes comparten el mismo cerebro. K3 Max maneja tareas cotidianas. K3 Swarm Max apunta una flota al problema.

La mayoría abre Kimi, escribe una pregunta, obtiene una respuesta y cierra la pestaña. Eso es aproximadamente el 10 % de lo que el producto puede hacer. Esta guía cubre el otro 90 %.

El enjambre no es un complemento. El orquestador es una política entrenada mediante Aprendizaje por Refuerzo con Agentes en Paralelo. Tú describes el objetivo. El enjambre decide cómo dividirlo, cuántos agentes generar y cómo unir los resultados. Los enjambres ganan en trabajos amplios y paralelizables: investigación en más de 50 fuentes, análisis por lotes, monitoreo competitivo, creación de conjuntos de datos. Fallan en tareas secuenciales profundas donde el paso 3 depende del paso 2.

- Escribe una especificación, no un prompt
"Investigar el mercado de apps de fitness" es la forma de quemar créditos y obtener basura. Un prompt de una línea le da permiso al enjambre para decidirlo todo. Y decidirá mal.

Trata al enjambre como a un contratista. Una especificación define qué recolectar, qué cuenta como válido, qué fuentes están permitidas, el formato exacto de salida y qué hacer en caso de conflicto. La especificación es el único artefacto de mayor apalancamiento en todo el flujo de trabajo, porque en el Nivel 2 se convierte en la semilla de tu Skill reutilizable.
1# PROYECTO: [nombre]2OBJETIVO: [una frase, el entregable, no el tema]3ALCANCE: [qué incluye, qué excluye explícitamente]4REGLAS: [validación, qué cuenta como hallazgo verificado]5FUENTES: [publicaciones oficiales, papers, solo primarias, sin agregadores]6SALIDA: [tipo de archivo / cantidad / nomenclatura / detalles de formato]7EN CONFLICTO: marcar la fila, nunca resolver en silencio8CONDICIÓN DE PARADA: [cuándo detenerse e informar en lugar de adivinar]
- Revisa el plan de descomposición antes de gastar
Después de enviar la especificación, Kimi te muestra el plan de ejecución antes de ejecutarlo: cuántos subagentes, qué maneja cada uno, el orden de dependencias, el presupuesto de pasos. Este es el paso que los principiantes se saltan, y es el más caro de saltarse.

Un enjambre de 200 agentes descompuesto incorrectamente cuesta dinero real. Revisar el plan no cuesta nada. Buscas tres cosas: si entiende el alcance, si la cantidad de agentes es sensata para la tarea, y si el plan de salida coincide con lo que realmente necesitas.
1Muéstrame la descomposición propuesta antes de ejecutar:2- cuántos subagentes y qué maneja cada uno3- el orden de dependencias (qué bloquea qué)4- presupuesto estimado de pasos5- dónde está el mayor riesgo de pérdida de calidad6NO ejecutes aún. Espera mi confirmación.
Un detalle que vale la pena saber: los 4000 pasos son un presupuesto coordinado total para todo el enjambre, no 4000 por agente. Una ejecución de 300 agentes promedia aproximadamente 13 pasos cada uno. Eso te dice si tu tarea se ajusta a la forma.
- Ejecútalo
Ahora ejecutas. Hasta 300 subagentes se lanzan en oleadas paralelas, cada uno en su propio contexto acotado. Solo la salida estructurada regresa al coordinador.
1Ejecuta la especificación de principio a fin.2Paraleliza donde el plan lo permita.3Reporta cualquier bloqueador de inmediato, no lo resuelvas en silencio.4Fusiona todo en la SALIDA definida en la especificación.
Lo que tienes después del Nivel 1
Una única salida del enjambre construida a partir de tu especificación. Cruda, sin verificar, pero estructurada. La mayoría se detiene aquí. El valor comienza en el Nivel 2.

- Exige archivos reales, no una respuesta de chat
"Un informe completo" les da permiso a los agentes para detenerse antes. "Un PDF de 40 páginas + un CSV con 20.000 filas + 14 gráficos PNG listos para exportar" les da un objetivo de calidad.
Encabeza siempre la especificación con la salida. La especificidad en el nivel de salida es la diferencia entre un equipo de investigación y una caja de sugerencias cara.
1# ejemplos de salida sólida:2SALIDA: 1 .xlsx, una fila por modelo, + resumen de 200 palabras3SALIDA: 30 archivos HTML, uno por tienda, nombrados por negocio4SALIDA: PDF de 40 páginas + CSV de 20.000 filas + 14 gráficos PNG
- Exige archivos reales, no una respuesta de chat
"Un informe completo" les da permiso a los agentes para detenerse antes. "Un PDF de 40 páginas + un CSV con 20.000 filas + 14 gráficos PNG listos para exportar" les da un objetivo de calidad. Encabeza siempre la especificación con la salida. La especificidad en el nivel de salida es la diferencia entre un equipo de investigación y una caja de sugerencias cara.
1# ejemplos de salida sólida:2SALIDA: 1 .xlsx, una fila por modelo, + resumen de 200 palabras3SALIDA: 30 archivos HTML, uno por tienda, nombrados por negocio4SALIDA: PDF de 40 páginas + CSV de 20.000 filas + 14 gráficos PNG
- Apunta un modelo independiente a la salida
La falla conocida del enjambre: a menos que exijas explícitamente verificación, produce afirmaciones seguras pero con pocas citas, y los subagentes independientes a veces se contradicen entre sí. "Parece listo" y "es correcto" son planetas distintos.
Usa un segundo modelo como puerta de verificación. Su única tarea: refutar, no elogiar. No estás pagando tokens premium por generar. Los estás pagando para atrapar la falla silenciosa antes de que el siguiente paso guarde el flujo de trabajo como un Skill reutilizable.

1Eres el VERIFICADOR. Un enjambre de agentes produjo la salida adjunta.2Tu única tarea es encontrar lo que está mal.34Verifica:5- ¿Toda cifra afirmada se remonta a una fuente nombrada?6- ¿Alguna sección contradice a otra?7- ¿Se presenta como hecho algo que en realidad es inferencia?8- ¿La salida coincide con los requisitos de formato de la especificación?910Para cada problema: indica la ubicación exacta y la solución.11Si todo está bien: APROBADO.12Si algo falla: RECHAZADO + la corrección más crítica primero.
- Guarda todo el flujo de trabajo como un Skill
Después de una ejecución verificada, dile a Kimi que capture todo el flujo de trabajo: formato de entrada, pasos de los agentes, formato de salida, reglas de validación. La primera ejecución toma 20 minutos. Cada ejecución posterior toma 30 segundos. El Skill es la razón por la que el sistema se acumula en lugar de reiniciarse cada vez.
1Guarda todo este flujo de trabajo como un Skill reutilizable: "[nombre]"2Captura:3- formato de entrada (qué archivos / forma de especificación espera)4- los pasos de los agentes que funcionaron5- el formato de salida y la convención de nomenclatura6- las reglas de validación de la especificación7La próxima vez que ejecute esto, adjunto archivos nuevos y obtengo la misma forma.
Lo que tienes después del Nivel 2
Una salida verificada en la que puedes confiar, y un Skill guardado que puedes reproducir sin reconstruir la especificación. Aquí es donde el bucle comienza a acumularse.

- Introduce tus propios documentos como conocimiento del enjambre
Los Skills capturan procesos. Documento a Skill captura dominio. Sube tu mejor trabajo y Kimi captura su huella estructural como un skill que todo enjambre futuro aplicará.

Cada PDF, transcripción u hoja de cálculo que ingreses se convierte en contexto contra el que se fundamentan los 300 agentes, en lugar de recurrir a los datos de entrenamiento. Cuanto más le alimentes, más la salida se leerá como tu trabajo en lugar de una IA genérica.
1Captura este documento como un skill reutilizable. Identifica qué lo hace funcionar:2- estructura y orden de secciones3- tono y registro de voz4- profundidad de análisis por sección5Guárdalo como "[nombre]". Luego produce un nuevo documento sobre [tema diferente]6usando el skill capturado. Iguala el nivel de calidad, no el contenido.
- Convierte cada rechazo en una regla permanente
El paso de verificación atrapa una falla una vez. Este paso asegura que el enjambre nunca la vuelva a cometer. Destila la retroalimentación en reglas estrictas y escríbelas en un archivo de restricciones que el enjambre lea antes de hacer cualquier cosa.
1# RESTRICCIONES.md, cargado automáticamente2- toda cifra afirmada debe remontarse a una fuente primaria o marcarse3- sin resolución de conflictos en silencio: mostrar contradicciones4- [regla destilada de la retroalimentación del verificador de la última ejecución]5- [el error que nunca quieres que se repita]6Alcance fijo: no tocar nada fuera del bloque ALCANCE de la especificación.
- Reproduce el skill con nuevas entradas
Aquí es donde "acumular" deja de ser una palabra de moda y aparece en la factura. La segunda ejecución no comienza desde cero. Comienza desde el skill, el conocimiento del enjambre y el archivo de restricciones que construiste arriba. Mismo flujo de trabajo, archivos nuevos, una fracción de la configuración.
La economía cambia drásticamente en la reproducción. El precio de acierto de caché de K3 baja a $0.30 por millón de tokens para contexto repetido, 10 veces más barato que el precio de entrada de la primera ejecución. El skill, las restricciones y la especificación son todo contexto repetido. Solo tus nuevos archivos de entrada cuestan la tarifa completa. La primera ejecución es una inversión. Cada ejecución posterior cosecha el retorno.

La salida también mejora estructuralmente. El Skill impone el formato. Las restricciones bloquean cada error que el verificador ya atrapó. El conocimiento del enjambre fundamenta a cada agente contra tus documentos reales en lugar de los datos de entrenamiento. La cuarta ejecución no solo cuesta menos que la primera. Produce mejores resultados, porque el sistema ha aprendido de tres rondas de retroalimentación real.

1Ejecuta el skill guardado "[nombre]" con estas nuevas entradas.2Aplica RESTRICCIONES.md. Usa el formato de salida capturado.3[adjuntar archivos nuevos]45Compara la salida de esta ejecución con la última.6Reporta:7- nuevos hallazgos no presentes la última vez8- hallazgos que cambiaron desde la última ejecución9- cualquier cosa que haya desaparecido (marcar como posible brecha)10- desviaciones de la forma esperada del skill
Lo que tienes después del Nivel 3
Un pipeline de investigación que se auto-mejora. Cada ejecución es más barata, más rápida y más precisa que la anterior porque la biblioteca de skills, la base de conocimiento y el archivo de restricciones siguen creciendo.

- Promueve el skill a un agente programado
Una vez que el bucle es estable y está respaldado por un skill, dejas de lanzarlo manualmente. Apunta a Kimi a un disparador: un horario, una nueva carga de archivos, una URL monitoreada. Deja que ejecute todo el enjambre de forma proactiva, mostrando solo el entregable y las desviaciones que merecen tu atención.

El monitoreo competitivo es el ejemplo claro. Primera ejecución: construyes y verificas a mano. Para cuando es un agente de fondo, está revisando a cada competidor en paralelo semanalmente y dejando un resumen en tu bandeja de entrada sin costo de tiempo marginal. El único humano que queda en el bucle eres tú con la pregunta que planteaste y la decisión que tomas sobre la respuesta.
1Ejecuta el skill "[nombre]" con una programación semanal.2Disparador: [horario / nuevo archivo / URL monitoreada]3En cada ejecución: ejecuta el enjambre, aplica RESTRICCIONES.md,4verifica, luego entrega la SALIDA + un diff vs la última ejecución.5Solo notifícame si una desviación supera [umbral].
Lo que 2,8 billones de parámetros no solucionan

La alucinación escala con el paralelismo. Cuantos más agentes buscan, más respuestas incorrectas seguras obtienes a menos que ejecutes un paso de verificación. El enjambre no se verifica a sí mismo.
K3 cuesta de 3 a 4 veces más que K2.6. Entrada: $3,00/M vs $0,95/M. Salida: $15,00/M vs $4,00/M. El caché ayuda en las reproducciones, pero la primera ejecución es cara. Para optimización de costos pura, K2.6 sigue siendo la opción económica.
Los pesos abiertos aún no están disponibles. Moonshot prometió que para el 27 de julio de 2026. Hasta entonces, K3 solo se ejecuta a través de la API y la app de Kimi.
Los enjambres amplifican las malas especificaciones. Un prompt vago a través de un agente desperdicia una ventana de contexto. A través de 300 agentes, desperdicia 300 en paralelo.
La lista breve
- Prompts de una línea. El enjambre lo decide todo. Decide mal.
- Saltarse la revisión de descomposición. El paso más caro de saltarse.
- No hacer un paso de verificación. "Parece listo" no es "es correcto".
- Guardar una salida no verificada como skill. El error se acumula en cada ejecución futura.
- 300 agentes en una tarea secuencial. Un enjambre no puede paralelizar una cadena de pensamiento.
- Usar K3 cuando K2.6 es suficiente. No toda tarea necesita 2,8 billones de parámetros.
Conclusión
La mayoría abrirá Kimi, escribirá una pregunta, cerrará la pestaña. Eso es la caja de chat. Es aproximadamente el 10 % de lo que K3 hace.
El otro 90 % es un equipo de investigación que construyes una vez y reproduces para siempre. Cada nivel desbloquea más apalancamiento: primero ejecución, luego confianza, luego acumulación, luego autonomía. No necesitas los cuatro el primer día. Empieza en el Nivel 1 con una especificación. Si la salida es útil, pasa al Nivel 2 y verifícala. Si planeas ejecutarla de nuevo, guarda el Skill. El sistema se vuelve más preciso a partir de ahí por sí solo.
Escribe la especificación, no el prompt. Verifica antes de guardar. Luego observa cómo cada ejecución se vuelve más barata y más precisa que la anterior.





