Kimi K3 Swarm Max: Cómo ejecutar 300 agentes de investigación desde un solo prompt

@choopyplug1
INGLÉShace 3 días · 22 jul 2026
105K
46
5
7
74

TL;DR

Esta guía explica cómo aprovechar la función Swarm Max de Kimi K3 para ejecutar 300 agentes en paralelo para investigaciones complejas, haciendo énfasis en especificaciones estructuradas y puertas de verificación.

Kimi K3 se lanzó el 16 de julio de 2026. 2,8 billones de parámetros. 1 millón de tokens de contexto. El modelo de pesos abiertos más grande jamás publicado.

La función estrella es K3 Swarm Max: hasta 300 subagentes ejecutándose en paralelo, coordinándose en más de 4000 pasos, produciendo archivos reales en lugar de respuestas de chat. Dos variantes comparten el mismo cerebro. K3 Max maneja tareas cotidianas. K3 Swarm Max apunta una flota al problema.

chuplung - inline image

La mayoría abre Kimi, escribe una pregunta, obtiene una respuesta y cierra la pestaña. Eso es aproximadamente el 10 % de lo que el producto puede hacer. Esta guía cubre el otro 90 %.

chuplung - inline image

El enjambre no es un complemento. El orquestador es una política entrenada mediante Aprendizaje por Refuerzo con Agentes en Paralelo. Tú describes el objetivo. El enjambre decide cómo dividirlo, cuántos agentes generar y cómo unir los resultados. Los enjambres ganan en trabajos amplios y paralelizables: investigación en más de 50 fuentes, análisis por lotes, monitoreo competitivo, creación de conjuntos de datos. Fallan en tareas secuenciales profundas donde el paso 3 depende del paso 2.

chuplung - inline image
  • Escribe una especificación, no un prompt

"Investigar el mercado de apps de fitness" es la forma de quemar créditos y obtener basura. Un prompt de una línea le da permiso al enjambre para decidirlo todo. Y decidirá mal.

chuplung - inline image

Trata al enjambre como a un contratista. Una especificación define qué recolectar, qué cuenta como válido, qué fuentes están permitidas, el formato exacto de salida y qué hacer en caso de conflicto. La especificación es el único artefacto de mayor apalancamiento en todo el flujo de trabajo, porque en el Nivel 2 se convierte en la semilla de tu Skill reutilizable.

text
1# PROYECTO: [nombre]
2OBJETIVO: [una frase, el entregable, no el tema]
3ALCANCE: [qué incluye, qué excluye explícitamente]
4REGLAS: [validación, qué cuenta como hallazgo verificado]
5FUENTES: [publicaciones oficiales, papers, solo primarias, sin agregadores]
6SALIDA: [tipo de archivo / cantidad / nomenclatura / detalles de formato]
7EN CONFLICTO: marcar la fila, nunca resolver en silencio
8CONDICIÓN DE PARADA: [cuándo detenerse e informar en lugar de adivinar]
  • Revisa el plan de descomposición antes de gastar

Después de enviar la especificación, Kimi te muestra el plan de ejecución antes de ejecutarlo: cuántos subagentes, qué maneja cada uno, el orden de dependencias, el presupuesto de pasos. Este es el paso que los principiantes se saltan, y es el más caro de saltarse.

chuplung - inline image

Un enjambre de 200 agentes descompuesto incorrectamente cuesta dinero real. Revisar el plan no cuesta nada. Buscas tres cosas: si entiende el alcance, si la cantidad de agentes es sensata para la tarea, y si el plan de salida coincide con lo que realmente necesitas.

text
1Muéstrame la descomposición propuesta antes de ejecutar:
2- cuántos subagentes y qué maneja cada uno
3- el orden de dependencias (qué bloquea qué)
4- presupuesto estimado de pasos
5- dónde está el mayor riesgo de pérdida de calidad
6NO ejecutes aún. Espera mi confirmación.

Un detalle que vale la pena saber: los 4000 pasos son un presupuesto coordinado total para todo el enjambre, no 4000 por agente. Una ejecución de 300 agentes promedia aproximadamente 13 pasos cada uno. Eso te dice si tu tarea se ajusta a la forma.

  • Ejecútalo

Ahora ejecutas. Hasta 300 subagentes se lanzan en oleadas paralelas, cada uno en su propio contexto acotado. Solo la salida estructurada regresa al coordinador.

text
1Ejecuta la especificación de principio a fin.
2Paraleliza donde el plan lo permita.
3Reporta cualquier bloqueador de inmediato, no lo resuelvas en silencio.
4Fusiona todo en la SALIDA definida en la especificación.

Lo que tienes después del Nivel 1

Una única salida del enjambre construida a partir de tu especificación. Cruda, sin verificar, pero estructurada. La mayoría se detiene aquí. El valor comienza en el Nivel 2.

chuplung - inline image
  • Exige archivos reales, no una respuesta de chat

"Un informe completo" les da permiso a los agentes para detenerse antes. "Un PDF de 40 páginas + un CSV con 20.000 filas + 14 gráficos PNG listos para exportar" les da un objetivo de calidad.

Encabeza siempre la especificación con la salida. La especificidad en el nivel de salida es la diferencia entre un equipo de investigación y una caja de sugerencias cara.

text
1# ejemplos de salida sólida:
2SALIDA: 1 .xlsx, una fila por modelo, + resumen de 200 palabras
3SALIDA: 30 archivos HTML, uno por tienda, nombrados por negocio
4SALIDA: PDF de 40 páginas + CSV de 20.000 filas + 14 gráficos PNG
  • Exige archivos reales, no una respuesta de chat

"Un informe completo" les da permiso a los agentes para detenerse antes. "Un PDF de 40 páginas + un CSV con 20.000 filas + 14 gráficos PNG listos para exportar" les da un objetivo de calidad. Encabeza siempre la especificación con la salida. La especificidad en el nivel de salida es la diferencia entre un equipo de investigación y una caja de sugerencias cara.

text
1# ejemplos de salida sólida:
2SALIDA: 1 .xlsx, una fila por modelo, + resumen de 200 palabras
3SALIDA: 30 archivos HTML, uno por tienda, nombrados por negocio
4SALIDA: PDF de 40 páginas + CSV de 20.000 filas + 14 gráficos PNG
  • Apunta un modelo independiente a la salida

La falla conocida del enjambre: a menos que exijas explícitamente verificación, produce afirmaciones seguras pero con pocas citas, y los subagentes independientes a veces se contradicen entre sí. "Parece listo" y "es correcto" son planetas distintos.

Usa un segundo modelo como puerta de verificación. Su única tarea: refutar, no elogiar. No estás pagando tokens premium por generar. Los estás pagando para atrapar la falla silenciosa antes de que el siguiente paso guarde el flujo de trabajo como un Skill reutilizable.

chuplung - inline image
text
1Eres el VERIFICADOR. Un enjambre de agentes produjo la salida adjunta.
2Tu única tarea es encontrar lo que está mal.
3
4Verifica:
5- ¿Toda cifra afirmada se remonta a una fuente nombrada?
6- ¿Alguna sección contradice a otra?
7- ¿Se presenta como hecho algo que en realidad es inferencia?
8- ¿La salida coincide con los requisitos de formato de la especificación?
9
10Para cada problema: indica la ubicación exacta y la solución.
11Si todo está bien: APROBADO.
12Si algo falla: RECHAZADO + la corrección más crítica primero.
  • Guarda todo el flujo de trabajo como un Skill

Después de una ejecución verificada, dile a Kimi que capture todo el flujo de trabajo: formato de entrada, pasos de los agentes, formato de salida, reglas de validación. La primera ejecución toma 20 minutos. Cada ejecución posterior toma 30 segundos. El Skill es la razón por la que el sistema se acumula en lugar de reiniciarse cada vez.

text
1Guarda todo este flujo de trabajo como un Skill reutilizable: "[nombre]"
2Captura:
3- formato de entrada (qué archivos / forma de especificación espera)
4- los pasos de los agentes que funcionaron
5- el formato de salida y la convención de nomenclatura
6- las reglas de validación de la especificación
7La próxima vez que ejecute esto, adjunto archivos nuevos y obtengo la misma forma.

Lo que tienes después del Nivel 2

Una salida verificada en la que puedes confiar, y un Skill guardado que puedes reproducir sin reconstruir la especificación. Aquí es donde el bucle comienza a acumularse.

chuplung - inline image
  • Introduce tus propios documentos como conocimiento del enjambre

Los Skills capturan procesos. Documento a Skill captura dominio. Sube tu mejor trabajo y Kimi captura su huella estructural como un skill que todo enjambre futuro aplicará.

chuplung - inline image

Cada PDF, transcripción u hoja de cálculo que ingreses se convierte en contexto contra el que se fundamentan los 300 agentes, en lugar de recurrir a los datos de entrenamiento. Cuanto más le alimentes, más la salida se leerá como tu trabajo en lugar de una IA genérica.

text
1Captura este documento como un skill reutilizable. Identifica qué lo hace funcionar:
2- estructura y orden de secciones
3- tono y registro de voz
4- profundidad de análisis por sección
5Guárdalo como "[nombre]". Luego produce un nuevo documento sobre [tema diferente]
6usando el skill capturado. Iguala el nivel de calidad, no el contenido.
  • Convierte cada rechazo en una regla permanente

El paso de verificación atrapa una falla una vez. Este paso asegura que el enjambre nunca la vuelva a cometer. Destila la retroalimentación en reglas estrictas y escríbelas en un archivo de restricciones que el enjambre lea antes de hacer cualquier cosa.

text
1# RESTRICCIONES.md, cargado automáticamente
2- toda cifra afirmada debe remontarse a una fuente primaria o marcarse
3- sin resolución de conflictos en silencio: mostrar contradicciones
4- [regla destilada de la retroalimentación del verificador de la última ejecución]
5- [el error que nunca quieres que se repita]
6Alcance fijo: no tocar nada fuera del bloque ALCANCE de la especificación.
  • Reproduce el skill con nuevas entradas

Aquí es donde "acumular" deja de ser una palabra de moda y aparece en la factura. La segunda ejecución no comienza desde cero. Comienza desde el skill, el conocimiento del enjambre y el archivo de restricciones que construiste arriba. Mismo flujo de trabajo, archivos nuevos, una fracción de la configuración.

La economía cambia drásticamente en la reproducción. El precio de acierto de caché de K3 baja a $0.30 por millón de tokens para contexto repetido, 10 veces más barato que el precio de entrada de la primera ejecución. El skill, las restricciones y la especificación son todo contexto repetido. Solo tus nuevos archivos de entrada cuestan la tarifa completa. La primera ejecución es una inversión. Cada ejecución posterior cosecha el retorno.

chuplung - inline image

La salida también mejora estructuralmente. El Skill impone el formato. Las restricciones bloquean cada error que el verificador ya atrapó. El conocimiento del enjambre fundamenta a cada agente contra tus documentos reales en lugar de los datos de entrenamiento. La cuarta ejecución no solo cuesta menos que la primera. Produce mejores resultados, porque el sistema ha aprendido de tres rondas de retroalimentación real.

chuplung - inline image
text
1Ejecuta el skill guardado "[nombre]" con estas nuevas entradas.
2Aplica RESTRICCIONES.md. Usa el formato de salida capturado.
3[adjuntar archivos nuevos]
4
5Compara la salida de esta ejecución con la última.
6Reporta:
7- nuevos hallazgos no presentes la última vez
8- hallazgos que cambiaron desde la última ejecución
9- cualquier cosa que haya desaparecido (marcar como posible brecha)
10- desviaciones de la forma esperada del skill

Lo que tienes después del Nivel 3

Un pipeline de investigación que se auto-mejora. Cada ejecución es más barata, más rápida y más precisa que la anterior porque la biblioteca de skills, la base de conocimiento y el archivo de restricciones siguen creciendo.

chuplung - inline image
  • Promueve el skill a un agente programado

Una vez que el bucle es estable y está respaldado por un skill, dejas de lanzarlo manualmente. Apunta a Kimi a un disparador: un horario, una nueva carga de archivos, una URL monitoreada. Deja que ejecute todo el enjambre de forma proactiva, mostrando solo el entregable y las desviaciones que merecen tu atención.

chuplung - inline image

El monitoreo competitivo es el ejemplo claro. Primera ejecución: construyes y verificas a mano. Para cuando es un agente de fondo, está revisando a cada competidor en paralelo semanalmente y dejando un resumen en tu bandeja de entrada sin costo de tiempo marginal. El único humano que queda en el bucle eres tú con la pregunta que planteaste y la decisión que tomas sobre la respuesta.

text
1Ejecuta el skill "[nombre]" con una programación semanal.
2Disparador: [horario / nuevo archivo / URL monitoreada]
3En cada ejecución: ejecuta el enjambre, aplica RESTRICCIONES.md,
4verifica, luego entrega la SALIDA + un diff vs la última ejecución.
5Solo notifícame si una desviación supera [umbral].

Lo que 2,8 billones de parámetros no solucionan

chuplung - inline image

La alucinación escala con el paralelismo. Cuantos más agentes buscan, más respuestas incorrectas seguras obtienes a menos que ejecutes un paso de verificación. El enjambre no se verifica a sí mismo.

K3 cuesta de 3 a 4 veces más que K2.6. Entrada: $3,00/M vs $0,95/M. Salida: $15,00/M vs $4,00/M. El caché ayuda en las reproducciones, pero la primera ejecución es cara. Para optimización de costos pura, K2.6 sigue siendo la opción económica.

Los pesos abiertos aún no están disponibles. Moonshot prometió que para el 27 de julio de 2026. Hasta entonces, K3 solo se ejecuta a través de la API y la app de Kimi.

Los enjambres amplifican las malas especificaciones. Un prompt vago a través de un agente desperdicia una ventana de contexto. A través de 300 agentes, desperdicia 300 en paralelo.

La lista breve

  • Prompts de una línea. El enjambre lo decide todo. Decide mal.
  • Saltarse la revisión de descomposición. El paso más caro de saltarse.
  • No hacer un paso de verificación. "Parece listo" no es "es correcto".
  • Guardar una salida no verificada como skill. El error se acumula en cada ejecución futura.
  • 300 agentes en una tarea secuencial. Un enjambre no puede paralelizar una cadena de pensamiento.
  • Usar K3 cuando K2.6 es suficiente. No toda tarea necesita 2,8 billones de parámetros.

Conclusión

La mayoría abrirá Kimi, escribirá una pregunta, cerrará la pestaña. Eso es la caja de chat. Es aproximadamente el 10 % de lo que K3 hace.

El otro 90 % es un equipo de investigación que construyes una vez y reproduces para siempre. Cada nivel desbloquea más apalancamiento: primero ejecución, luego confianza, luego acumulación, luego autonomía. No necesitas los cuatro el primer día. Empieza en el Nivel 1 con una especificación. Si la salida es útil, pasa al Nivel 2 y verifícala. Si planeas ejecutarla de nuevo, guarda el Skill. El sistema se vuelve más preciso a partir de ahí por sí solo.

Escribe la especificación, no el prompt. Verifica antes de guardar. Luego observa cómo cada ejecución se vuelve más barata y más precisa que la anterior.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales