Uno de los detalles que ha capturado la imaginación de la comunidad de X es que Kimi K3 tiene un estado constante. En otras palabras, no tiene un caché KV que crezca linealmente a medida que el contexto se expande o tu conversación se alarga (en su mayor parte, ya veremos los detalles y salvedades pronto).
Los casos de uso de contexto largo —por ejemplo, la programación agéntica— han aumentado enormemente la demanda de memoria, lo que ha resultado en un incremento de 10 a 30 veces en los precios de las acciones de memoria. Si no necesitas tanta memoria para almacenar el caché KV, ¿está justificado este aumento de precio? Hay un debate muy activo sobre este tema en X.
Los detractores dicen que la atención lineal híbrida que usa Kimi K3, llamada Kimi Delta Attention (KDA), existe desde hace bastante tiempo. Por lo tanto, ya está descontada en los precios de las acciones de memoria.
Sin embargo, pasan por alto que —a diferencia de intentos anteriores— Kimi K3 demostró que la atención lineal híbrida puede funcionar tan bien a una escala de 1 billón+ de parámetros y ofrecer un rendimiento de frontera. Esta es información COMPLETAMENTE NUEVA y merece una atención seria. Antes de Kimi K3, se creía que la atención lineal híbrida no era una técnica para la frontera, sino solo un truco interesante utilizado por
- Qwen (que nunca llega del todo a la frontera) o
- Nvidia (que prueba todo lo que hay bajo el sol, solo porque tienen GPUs infinitas).
¡Vamos a profundizar!
(Quiero dejar claro que ESTO NO ES UN CONSEJO DE INVERSIÓN).
Breve historia de la atención lineal híbrida:
Los modelos lineales siempre han sido muy prometedores en teoría, al igual que el comunismo.
En lugar de un caché KV que crece constantemente a medida que el contexto se expande, tienen un estado constante que se actualiza. El tamaño del estado es constante, ya sea que tengas mil tokens o un millón de tokens.
Suena demasiado bueno para ser verdad, ¡porque lo es! Los modelos lineales tienen problemas para recordar contenido de partes anteriores de la conversación con precisión —por ejemplo, un número de teléfono de una parte anterior de la conversación.
¿Por qué? Esto se debe a que estos modelos actualizan constantemente su 'resumen' interno (llamado estado) del contexto. Sin embargo, dado que este contexto/resumen tiene un tamaño fijo (por ejemplo, 128128 en el caso de Kimi K3, por cabeza), su capacidad de almacenamiento es limitada. Comprime información para ser eficiente (eso es lo que el modelo aprende durante su entrenamiento), pero tiene que descartar algo de información sin duda. En otras palabras, la compresión es con pérdida.*
Una forma de resolver el problema es optar por una 'atención lineal híbrida' donde combinas capas lineales (típicamente el 75%) con capas de atención completa (el 25%). La atención lineal híbrida también puede tener una versión eficiente de atención completa (por ejemplo, el estilo MLA de DeepSeek en el caso de Kimi K3). ¡Si bien esto se intentó, los modelos lineales híbridos anteriores no tenían un rendimiento a nivel de frontera!
Lo que Kimi K3 demostró es que —con su variación llamada Kimi Delta Linear Attention (KDA) — se puede lograr un recuerdo casi perfecto, tan bueno como el de los modelos que usan atención completa en todas las capas. Esto es un avance masivo, sin importar lo que te hayan hecho creer al respecto...
¿Cómo lo logró Kimi K3?
Moonshot no es el primero en usar atención lineal híbrida, pero crearon una variación que es altamente efectiva. Permite un control preciso sobre la decadencia de la memoria.
Por supuesto, hicieron muchas otras cosas, que involucran ingeniería de datos, desarrollo de kernels, uso de residuos de atención, MoE latente estable, etc. (las entenderemos hacia el final). Pero hicieron algo aparentemente simple que resultó en una ganancia de rendimiento excepcional en la parte de atención.
El estado KDA del modelo puede considerarse esencialmente como una pila de recuerdos (versión simplificada). En cada nueva posición de token, se calcula una matriz diagonal y el estado se multiplica por ella. Esto resulta en olvidar algunos recuerdos más y otros menos (jerga: decadencia por canal). En versiones anteriores, olvidarías todos los recuerdos en la misma medida. ¡Este truco de olvidar selectiva y juiciosamente mejoró significativamente el rendimiento!

Esta es una visualización hermosa que muestra cómo ocurren las actualizaciones de la matriz de estado. Tendré otro blog próximamente que explicará cómo esto lleva al santo grial del "aprendizaje continuo".

¿Cuánto ahorro de memoria hay con Kimi K3?**
K3 tiene 93 capas y 96 cabezas. KDA tiene dimensiones dv y dk de 128.

Veamos qué se necesita para procesar 128K tokens y 1 millón de tokens en términos de almacenamiento de estado y KV. Veamos dos casos:
1) 93 capas de atención completa MLA (All-MLA) vs.
2) 69 KDA + 24 atención completa MLA (modelo real de Kimi K3 como se muestra arriba)
Al final del artículo he publicado los cálculos.
Observaciones clave:
**1. Para All-MLA, el almacenamiento del caché KV crece de 13.7 GB a 107 GB de 128K a 1M tokens.
- Como puedes ver, el estado KDA para Kimi K3 es constante en 0.22 GB, independientemente de la longitud del contexto. Solo la parte MLA crece de 3.5 GB a 29 GB de 128K a 1M tokens de contexto.
En ambos casos, hay un ahorro de aproximadamente el 73%. La belleza es que KDA no compromete el rendimiento de frontera mientras ofrece estos ahorros. MLA ya es un ahorro masivo sobre MHA y GQA (casi un 90%), ¡KDA ahorra un 73%!
Algunos argumentarán que los ahorros con la arquitectura DeepSeek V4 a la escala de Kimi K3 serían aún mayores. Cierto, DeepSeek V4 aún no está en la frontera. E incluso si llega a la frontera, mejorará exactamente en la misma dirección: menos almacenamiento.

Esta hermosa visualización producida por el propio Kimi K3 muestra los ahorros:

¿Es Kimi K3 único en la industria cuando se trata de un ahorro de memoria tan dramático?
DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) ha hecho un trabajo excepcional reduciendo el caché KV en un 98%, pero nadie los considera cerca de la frontera. Cuando se lanzó DeepSeek V4, ¿observaste el mismo nivel de actividad en X?
Además, por su brillantez, todas las capas de DeepSeek V4 son CSA (Compressed Sparse Attention) o HCA (Highly Compressed Attention) — ambos tipos están comprimidos a lo largo de la dimensión de la secuencia y tienen pérdida. No hay una sola capa que tenga información sin comprimir, es decir, todas las capas tienen pérdida: recuerda que en Kimi K3, el 25% de las capas tienen atención completa**.
Mi hipótesis es que Kimi K3 tendrá una mejor capacidad para recuperar información específica de contextos anteriores en escenarios de contexto largo. Por lo tanto, preveo que la arquitectura de Kimi K3 será ampliamente adoptada por otros laboratorios también (por ejemplo, ZAI, MiniMax, Qwen, Tencent, Xiaomi, etc.), al igual que DeepSeek V3 (MLA) y más tarde DeepSeek V3.2 (MLA + DSA) se generalizaron en la industria.

CSA de DeepSeek. Observa la compresión a lo largo de la dimensión de la secuencia. Resulta en 1 token comprimido por cada 4 tokens.
**

HCA de DeepSeek. Observa la compresión a lo largo de la dimensión de la secuencia. Resulta en 1 token comprimido por cada 128 tokens.
¿Qué pasa con el punto de Funda AI de que necesitas almacenar en caché el estado KDA múltiples veces, ya que no es aditivo como el caché KV? Además, ¿los subagentes no necesitarán almacenamiento de caché KV?
Recuerda el ejemplo anterior, el estado KDA total en 69 capas es de 0.22 GB. Por lo tanto, incluso cuando lo almacenas en caché/capturas instantáneas cada 20K tokens durante una sesión larga, son 50 veces en un contexto de 1M.
Por lo tanto, estas 50 instantáneas ocuparán 50*0.22 GB. Todo suma solo 11 GB - el total (29.22 GB + 11 GB) se mantiene muy por debajo de los 107 GB requeridos para All-MLA en un contexto de 1M tokens.
En segundo lugar, el punto de Funda AI era que los agentes principales pueden generar subagentes. La gente generará muchos subagentes. Pero típicamente, una vez que un subagente devuelve el control al principal, su trabajo termina. Su KV + estado se eliminan. Por lo tanto, incluso si la gente lanza agentes que lanzan cientos de subagentes, las necesidades de KV + estado no son a largo plazo. El estado de la sesión principal / agente principal necesita conservarse por mucho más tiempo; ¡y aquí es donde KDA ahorra muchísimo!
Existen patrones donde hay agentes asíncronos de larga duración, en esos casos su KV + estado necesitarían mantenerse. Pero veo que esos patrones se implementan raramente. Esto no quiere decir que no cambiará en el futuro.
Subagentes síncronos (un patrón muy común):

Subagentes asíncronos (un patrón relativamente raro)

¿Tendrá entonces la adopción de KDA un impacto a la baja en la demanda de memoria?
No soy un adivino, pero hay una probabilidad pequeña y no nula de que reviente la burbuja de la memoria.
Primero, por qué puede no tener ningún impacto en la demanda de memoria:
- Si bien los ahorros son reales, si el código abierto de IA se adopta ampliamente, la mayoría de las implementaciones no serán tan eficientes como lo son en los laboratorios de frontera cerrados. Por lo tanto, cualquier ganancia a nivel de modelo se perderá a nivel de la industria. Tendremos un gran número de implementaciones pequeñas que no son muy eficientes. Por ejemplo, para la mayoría de las empresas y gobiernos, el uso ocurre durante 12 horas al día. ¿Qué hará su infraestructura de modelo de código abierto y su memoria por la noche? La infraestructura en los grandes laboratorios se utiliza las 24 horas del día, los 7 días de la semana, debido a la base de clientes global.
- Además, estamos haciendo una gran suposición de que los laboratorios líderes ya no tienen enfoques similares. OpenAI, Anthropic, DeepMind emplean a algunas de las personas más inteligentes del mundo. Por lo tanto, hay bastantes posibilidades de que estas innovaciones ya estén en uso y ya se hayan descontado en la demanda de memoria.
Dicho esto, de vez en cuando aparece un SpaceX que muestra a los líderes de la industria lo ineficientes que eran sus enfoques. Ellos piensan desde los primeros principios. Los actores establecidos, debido a problemas de estructura organizativa o por no tener suficiente hambre, no innovan en dimensiones clave. La historia del capitalismo está llena de miles de ejemplos como este...

Por lo tanto, es un escenario poco probable, pero aún con alguna probabilidad no nula, de que si los grandes laboratorios no tuvieran tanta escasez de recursos, es posible que no hubieran explorado todo el espacio de diseño para reducir la demanda de memoria hasta tal punto.
En la propia industria de la IA, ha sucedido muchas veces antes donde los grandes laboratorios han mostrado una gran incompetencia:
- El pipeline de entrenamiento de XAI tenía un MFU (utilización de GPU) pobre, debido al hábito de lanzar potencia de cómputo al problema, más otros problemas de configuración del clúster y problemas a nivel organizativo.
- A pesar de todos los recursos a su disposición, Meta entrenó una versión pésima del MoE de DeepSeek para Llama 4.
- Google tardó 1.5 años desde el lanzamiento de ChatGPT en llevar Gemini a la vanguardia y todavía no es el modelo favorito de nadie para el caso de uso más popular: la programación con IA.

Las limitaciones fuerzan la innovación, por lo que no es improbable que equipos pequeños y bien organizados superen a equipos grandes y ricos en recursos. Y ahora que K3 se ha lanzado y su arquitectura es bien conocida, si una técnica similar a KDA —que ahora tiene éxito a escala de frontera— también es adoptada por laboratorios cerrados, significaría una reducción del 75% en la demanda de memoria, al menos para algunos laboratorios, y ellos son bastante grandes individualmente, por lo que el impacto podría ser de decenas de miles de millones.
Estos ahorros de memoria podrían ser consumidos por un mayor uso debido a la reducción de costos, sin duda (paradoja de Jevons), pero no está garantizado que el crecimiento del consumo siempre supere los ahorros...

Difusión de otras innovaciones: ¡La innovación principal de Kimi K3 no es solo KDA!
Kimi K3 elimina por completo la codificación posicional: Las codificaciones posicionales informan cuál es el número de secuencia de cada token en el contexto. Sus capas KDA, debido a su naturaleza recurrente, no necesitan codificaciones posicionales. Las eliminan incluso para las capas MLA y no perjudica. ¿Beneficios? No requiere ningún esfuerzo especial para extender la longitud de contexto del modelo en comparación con modelos anteriores. Elegante.
Kimi K3 implementa residuos de atención a escala de 2.8T: Asegura, efectivamente, que las capas superiores puedan prestar atención selectiva a las entradas de las capas inferiores. En enfoques anteriores, las capas superiores no podían distinguir entre las entradas de las capas inferiores en una posición de token dada, ya que todos los valores solían agregarse. Este nuevo enfoque le da al modelo una discernibilidad mucho mayor. (https://arxiv.org/pdf/2603.15031
Kimi K3 implementa Stable Latent MoE de Nvidia: El principal beneficio de una arquitectura latente de Mezcla de Expertos (LatentMoE) estable es una mayor precisión del modelo y más capacidad de experto al mismo o menor costo de inferencia. Lo logra proyectando las representaciones de los tokens en un espacio latente más pequeño antes de ejecutar el enrutamiento y el cálculo de los expertos. Lo tomaron del artículo de Nvidia de enero de 2026 (https://arxiv.org/pdf/2601.18089v1

Con todas estas innovaciones juntas, el equipo de MoonShot logró una eficiencia de entrenamiento 2.5 veces mayor que su arquitectura anterior, Kimi K2. Esto quiere decir que logran la misma pérdida de validación con 2.5 veces menos FLOPs. ¡¡Esto es un ahorro masivo incluso para el cómputo de entrenamiento!! ¡¡Esto permitirá que muchos más laboratorios entrenen modelos de tan alta escala con cómputo limitado...

Con K3, Moonshot desbloqueó nuevas leyes de escalamiento. Kimi K3 logra una ganancia de 2.5× en eficiencia de escalamiento sobre Kimi K2
MoonShot también ha publicado como código abierto su kernel GPU FlashKDA para el cálculo rápido del estado KDA y MoonMoE para el envío y combinación de tokens. Están bastante seguros de compartir tanto conocimiento, porque ya están trabajando en el próximo conjunto de innovaciones que los llevarán aún más lejos (al fin y al cabo, ellos también son capitalistas).

Las leyes de escalamiento no son leyes de la naturaleza, siempre podemos descubrir otras mejores
Además, podemos descubrir nuevas leyes de escalamiento con nuevas arquitecturas y paradigmas de entrenamiento, ofreciendo una inteligencia aún más densa. Las leyes de escalamiento son observaciones estadísticas, no son leyes de la naturaleza que no se puedan cambiar. Lo que esto significa es que con modelos más nuevos, de menor tamaño (y menor KV y estado), podemos tener un mejor rendimiento. Por lo tanto, la explosión de la demanda no significa ejecutar los mismos modelos grandes para siempre. Los modelos seguirán volviéndose más densos en términos de inteligencia.**
Tenemos un ecosistema en forma de laboratorios chinos que está altamente limitado y es altamente capaz —una combinación muy potente, como se ha discutido. Están descubriendo rincones del espacio de diseño que no han sido descubiertos por laboratorios con mejor financiación. Hacen progresos rápidos debido al intercambio abierto de conocimiento. Esto evita que otros desperdicien sus esfuerzos reinventando la rueda. La evolución de la arquitectura ocurre mucho más rápidamente que de otra manera...
Además, este éxito del equipo de MoonShot seguramente inspirará a otros equipos igualmente capaces en DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED e incluso actores emergentes como Baidu, Ant Ling, Xiaomi Mimo, Meituan y muchos otros a ser los mejores, no solo como modelo de código abierto, sino para ser los mejores en general.
Muchas innovaciones nuevas ocurrirán en laboratorios emergentes en Occidente también, ya sea en xAI o MSL ahora que han puesto su casa en orden y han comenzado a ofrecer grandes modelos.
Dicho esto, como sigo señalando, China tiene la mayor cantidad de jóvenes investigadores de IA según las estadísticas de NEURIPS. Las contribuciones en este campo provienen desproporcionadamente más de investigadores jóvenes (el hilo fuente), por lo que es probable que surjan muchos más avances de esa parte del mundo.

China también tiene 3 centros urbanos principales con una densidad de talento en IA que rivaliza con la de Silicon Valley, actúan como crisoles de mezcla de ideas (el hilo fuente).

Prohibir la IA de código abierto no ayudará:
Una conclusión desafortunada de esta discusión podría ser que debemos prohibir la IA de código abierto para proteger los mercados occidentales. Pero eso sería altamente contraproducente.
Ya sea que la IA de código abierto esté prohibida o no en el mundo occidental, estos espacios de diseño se explorarán y se publicarán artículos. Occidente también tiene muchos laboratorios nuevos y excelentes emergiendo. Descubrirán muchas ideas nuevas también, ahora que se ha dado cuenta de que todavía son posibles muchas ganancias de eficiencia.
Lo mejor es fomentar y adoptar estas innovaciones, ser responsables con las inversiones y evitar la especulación desenfrenada.
El futuro es muy, muy brillante debido a esta tecnología, pero tenemos que tener cuidado de no ser especuladores locos que reciben una llamada de margen.
No hemos estado usando tanta IA como podríamos: ya sea en el mundo corporativo, la educación, la investigación o el entretenimiento.
- Si bien la programación ha sido el pilar del uso de tokens de GenAI, aplicaciones como CoWorker apenas han comenzado.
- Me encantaría que cada estudiante en India tuviera acceso ilimitado a modelos de nivel Opus 4.8 o Kimi K3. Tienen acceso, pero solo a modelos más débiles.
- Además, podríamos tener casos de uso de IA de mucho mayor valor en Ciencia, Ingeniería y Medicina.
- También, tenemos un mundo que envejece del que debemos cuidar. La IA será de gran beneficio allí. Existen tantas posibilidades en el entretenimiento y los juegos también. Como mencionó Jensen Huang: "cada píxel que vemos en la pantalla para entretenimiento será generado".
Conclusión:


El colapso del mercado de valores de 1929, la Gran Depresión, no fue el resultado de la destrucción de la demanda. Fue el resultado de excesos especulativos. El mundo entero sufrió durante dos décadas. Podría argumentarse que llevó al auge del Fascismo y la Segunda Guerra Mundial.
**
Si bien el futuro es incierto, lo que está claro en mis observaciones es que los alcistas de la IA y los alcistas de la memoria, en particular, no tienen en cuenta las innovaciones algorítmicas y el descubrimiento de nuevas leyes de escalamiento. Para ellos, todo es devorado por la paradoja de Jevons, por lo tanto, no es interesante. Esta actitud se ha filtrado también a los inversores minoristas y ha llevado a un comportamiento insano que tiene el potencial de derribar las economías de varios países. **Quiero introducir nuevos ángulos en su análisis. Ellos tienen información mucho mejor sobre las situaciones de la cadena de suministro y las ganancias corporativas. Quiero armarlos con una perspectiva más técnica.
Para colapsar las acciones de memoria e IA, no necesitamos una reducción masiva de la demanda, como ha señalado Jaya Gupta. Incluso una pequeña reducción de la demanda puede iniciar una competencia de teoría de juegos en la que los tenedores actuales comiencen a tomar ganancias con la intención de comprar acciones más tarde, esto puede colapsar todo el mercado. Y esto parece haber comenzado...
Es importante no permitir que se formen burbujas tan grandes y que estallen catastróficamente para la sociedad. En general, me mantengo muy optimista sobre el potencial de esta tecnología (e incluso de la demanda de memoria) y la futura construcción de infraestructura. ¡Es la época más emocionante para estar vivo!
(NO ES UN CONSEJO DE INVERSIÓN)
Apéndice
Cálculo detallado de los ahorros de memoria:
Para mostrar lo bueno que es Kimi K3, le pedí al propio K3 que hiciera estos cálculos; he verificado que son correctos. Como se mencionó anteriormente, consideramos dos casos:
1) Kimi K3: 69 KDA + 24 Gated MLA de atención completa vs.
2) Full MLA: 93 MLA de atención completa








