Uno de los detalles que ha capturado la imaginación de la comunidad de X es que Kimi K3 tiene un estado constante. En otras palabras, no tiene una caché KV que crezca linealmente a medida que el contexto se expande o la conversación se alarga (en su mayor parte, ya veremos los detalles y salvedades pronto).
Los casos de uso de contexto largo - por ejemplo, la codificación agente - han aumentado masivamente la demanda de memoria, resultando en un aumento de 10 a 30 veces en los precios de las acciones de memoria. Si no necesitas tanta memoria para almacenar la caché KV, ¿está justificado este aumento de precio? Hay un debate muy activo sobre este tema en X.
Los detractores dicen que la Atención Lineal Híbrida utilizada por Kimi K3, llamada Atención Delta Kimi (KDA), existe desde hace bastante tiempo. Por lo tanto, ya está descontada en los precios de las acciones de memoria.
Sin embargo, pasan por alto el punto clave: a diferencia de intentos anteriores, Kimi K3 demostró que la Atención Lineal Híbrida podía funcionar tan bien a una escala de 1T+ parámetros y ofrecer un rendimiento de frontera. Esto es información COMPLETAMENTE NUEVA y merece una atención seria. Antes de Kimi K3, se creía que la Atención Lineal Híbrida no era una técnica para la frontera, sino solo un truco ingenioso utilizado por
- Qwen (que nunca llega realmente a la frontera) o
- Nvidia (que lo prueba todo bajo el sol, solo porque tienen infinitas GPU).
¡Vamos a profundizar!
(Quiero dejar claro - ESTO NO ES UN ASESORAMIENTO DE INVERSIÓN).
Breve historia de la Atención Lineal Híbrida:
Los modelos lineales siempre han sido muy prometedores sobre el papel, al igual que el comunismo.
En lugar de una caché KV en constante crecimiento a medida que el contexto se expande, tienen un estado constante que se actualiza. El tamaño del estado es constante, ya sea que tengas mil tokens o un millón de tokens.
Suena demasiado bueno para ser verdad, ¡porque lo es! Los modelos lineales tienen problemas para recordar contenido de partes anteriores de la conversación perfectamente, por ejemplo, un número de teléfono de una parte anterior de la conversación.
¿Por qué? Esto se debe a que estos modelos actualizan constantemente su 'resumen' interno (llamado estado) del contexto. Sin embargo, dado que este contexto/resumen tiene un tamaño fijo (por ejemplo, 128\128 en el caso de Kimi K3, por cabeza), su capacidad de almacenamiento es limitada. Comprime la información para ser eficiente (eso es lo que el modelo aprende durante su entrenamiento), pero tiene que descartar algo de información con seguridad. En otras palabras, la compresión es con pérdida.*
Una forma de resolver el problema es optar por una arquitectura 'lineal híbrida' donde se combinan capas lineales (típicamente 75%) con capas de atención completa (25%). La Atención Lineal Híbrida también puede tener una versión eficiente de la atención completa (por ejemplo, el estilo MLA de DeepSeek en el caso de Kimi K3). Si bien esto se intentó, los modelos lineales híbridos anteriores no tenían un rendimiento a nivel de frontera.
Lo que Kimi K3 demostró es que - con su variación llamada Atención Lineal Delta Kimi (KDA) - se puede lograr un recuerdo casi perfecto, tan bueno como el de los modelos que utilizan atención completa en todas las capas. Esto es un avance masivo, independientemente de lo que te hayan hecho creer al respecto...
¿Cómo lo logró Kimi K3?
Moonshot no es el primero en usar atención lineal híbrida, pero ideó una variación que es altamente efectiva. Permite un control fino sobre la decadencia de la memoria.
Por supuesto, hicieron muchas otras cosas, que involucran ingeniería de datos, desarrollo de kernels, etc., uso de residuos de atención, MoE latente estable, etc. (los entenderemos hacia el final). Pero hicieron algo aparentemente simple que resultó en una ganancia de rendimiento excepcional en la parte de atención.
El estado KDA del modelo se puede considerar esencialmente como una pila de recuerdos (versión simplificada). En cada nueva posición de token, se calcula una matriz diagonal y el estado se multiplica por ella. Esto da como resultado que algunos recuerdos se olviden más y otros menos (jerga: decadencia por canal). En versiones anteriores, olvidarías todos los recuerdos en la misma medida. Este truco de olvidar selectiva y juiciosamente mejoró significativamente el rendimiento.

Esta es una visualización hermosa que muestra cómo ocurren las actualizaciones de la matriz de estado. Tendré otro blog próximamente que explicará cómo esto lleva al santo grial del "aprendizaje continuo".

¿Cuánto ahorro de memoria hay con Kimi K3?
K3 tiene 93 capas y 96 cabezas. KDA tiene dimensiones dv y dk de 128.

Veamos qué se necesita para procesar 128K tokens y 1 millón de tokens en términos de almacenamiento de estado y KV. Veamos dos casos:
1) 93 capas de atención completa MLA (All-MLA) vs.
2) 69 KDA + 24 atención completa MLA (el modelo Kimi K3 real representado arriba)
Al final del artículo he publicado los cálculos.
Observaciones clave:
- Para All-MLA, el almacenamiento de caché KV crece de 13.7 GB a 107 GB de 128K a 1M tokens.
- Como se puede ver, el estado KDA para Kimi K3 es constante en 0.22 GB, independientemente de la longitud del contexto. Solo la parte MLA crece de 3.5 GB a 29 GB desde un contexto de 128K a 1M tokens.
En ambos casos, hay un ahorro de aproximadamente el 73%. La belleza es que KDA no compromete el rendimiento de frontera mientras ofrece estos ahorros. MLA ya es un ahorro masivo sobre MHA y GQA (casi un 90%), ¡KDA ahorra un 73%!
Algunos argumentarán que los ahorros con la arquitectura DeepSeek V4 a la escala de Kimi K3 serían aún mayores. Cierto, DeepSeek V4 aún no está en la frontera. E incluso si llega a la frontera, mejorará exactamente en la misma dirección: menos almacenamiento.

Esta hermosa visualización producida por el propio Kimi K3 muestra los ahorros:

¿Es Kimi K3 único en la industria en cuanto a un ahorro de memoria tan dramático?
DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) ha hecho un trabajo excepcional reduciendo la caché KV en un 98%, pero nadie los considera cerca de la frontera. Cuando se lanzó DeepSeek V4, ¿observaste el mismo nivel de actividad en X?
Además, por todo su brillantez, todas las capas de DeepSeek V4 son CSA (Atención Comprimida Dispersa) o HCA (Atención Altamente Comprimida) - ambos tipos se comprimen a lo largo de la dimensión de secuencia y es con pérdida. No hay una sola capa que tenga información sin comprimir, es decir, todas las capas son con pérdida; en Kimi K3, el 25% de las capas tienen atención completa.
Mi hipótesis es que Kimi K3 tendrá una mejor capacidad para recuperar información específica de contextos anteriores en escenarios de contexto largo. Por lo tanto, preveo que la arquitectura de Kimi K3 será ampliamente adoptada por otros laboratorios también (por ejemplo, ZAI, MiniMax, Qwen, Tencent, Xiaomi, etc.), al igual que DeepSeek V3 (MLA) y posteriormente DeepSeek V3.2 (MLA + DSA) se generalizaron en la industria.

CSA de DeepSeek. Nótese la compresión a lo largo de la dimensión de secuencia. Resulta en 1 token comprimido por cada 4 tokens.
**

HCA de DeepSeek. Nótese la compresión a lo largo de la dimensión de secuencia. Resulta en 1 token comprimido por cada 128 tokens.
¿Qué hay del punto de Funda AI de que necesitas almacenar en caché el estado KDA varias veces, ya que no es aditivo como la caché KV? Además, ¿los subagentes no necesitarán almacenamiento de caché KV?
Recuerda el ejemplo anterior, el estado KDA total en 69 capas es de 0.22 GB. Por lo tanto, incluso cuando lo almacenas en caché/haces una instantánea cada 20K tokens durante una sesión larga, son 50 veces en un contexto de 1M.
Por lo tanto, estas 50 instantáneas ocuparán 50 * 0.22 GB. Todo suma solo 11 GB; el total (29.22 GB + 11 GB) se mantiene muy por debajo de los 107 GB requeridos para All-MLA en un contexto de 1M tokens.
En segundo lugar, el punto de Funda AI era que los agentes principales pueden generar subagentes. La gente generará muchos subagentes. Pero típicamente, una vez que un subagente devuelve el control al agente principal, su trabajo ha terminado. Su KV + estado se eliminan. Por lo tanto, incluso si las personas lanzan agentes que lanzan cientos de subagentes, las necesidades de KV + estado no son a largo plazo. El estado de la sesión principal / agente principal necesita conservarse por mucho más tiempo; ¡y ahí es donde KDA ahorra mucho!
Hay patrones donde hay agentes asíncronos de larga duración, en esos casos su KV + estado necesitarían mantenerse. Pero veo esos patrones implementados raramente. Esto no quiere decir que no cambiará en el futuro.
Subagentes síncronos (un patrón muy común):

Subagentes asíncronos (un patrón relativamente raro)

¿Tendrá entonces la adopción de KDA un impacto a la baja en la demanda de memoria?
No soy adivino, pero hay una probabilidad pequeña y no nula de que reviente la burbuja de la memoria.
Primero, por qué puede no tener ningún impacto en la demanda de memoria:
- Si bien los ahorros son reales, si la IA de código abierto se adopta ampliamente, la mayoría de las implementaciones no serán tan eficientes como lo son en los laboratorios de frontera cerrados. Por lo tanto, cualquier ganancia a nivel de modelo se perderá a nivel de industria. Tendremos un gran número de implementaciones pequeñas que no son muy eficientes. Por ejemplo, para la mayoría de las empresas y gobiernos, el uso ocurre durante 12 horas al día. ¿Qué hará su infraestructura de modelo de código abierto y su memoria por la noche? La infraestructura en los grandes laboratorios se utiliza las 24 horas del día, los 7 días de la semana, debido a una base de clientes global.
- Además, estamos haciendo una gran suposición de que los laboratorios líderes ya no tienen enfoques similares. OpenAI, Anthropic, DeepMind emplean a algunas de las personas más inteligentes del mundo. Por lo tanto, hay bastantes posibilidades de que tales innovaciones ya estén en uso y se hayan tenido en cuenta en la demanda de memoria.
Dicho esto, de vez en cuando aparece un SpaceX que les muestra a los líderes de la industria lo ineficientes que eran sus enfoques. Piensan desde los primeros principios. Los titulares, debido a problemas de estructura organizativa, o por no tener suficiente hambre, no innovan en dimensiones clave. La historia del capitalismo está llena de miles de ejemplos de este tipo...

Por lo tanto, es un escenario improbable, pero aún con alguna probabilidad no nula - de que si los grandes laboratorios no tuvieran tanta escasez de recursos, es posible que no hubieran explorado todo el espacio de diseño para reducir la demanda de memoria hasta tal punto.
En la propia industria de la IA, esto ha sucedido muchas veces antes, donde los grandes laboratorios han mostrado una gran incompetencia:
- El pipeline de entrenamiento de XAI tenía un MFU (utilización de GPU) pobre - debido al hábito de lanzar capacidad de cómputo al problema, además de otras malas configuraciones del clúster y problemas a nivel organizativo.
- A pesar de todos los recursos a su disposición, Meta entrenó una versión pésima del MoE de DeepSeek para Llama 4.
- Google tardó 1.5 años desde el lanzamiento de ChatGPT en llevar Gemini a la vanguardia y todavía no es el modelo favorito de nadie para el caso de uso más popular: la codificación con IA.

Las limitaciones fuerzan la innovación, por lo que no es improbable que equipos pequeños y altamente organizados superen a equipos grandes y ricos en recursos. Y ahora que K3 está disponible y su arquitectura es bien conocida, si una técnica como KDA - que ahora tiene éxito a escala de frontera - también es adoptada por laboratorios cerrados; significa una reducción del 75% en la demanda de memoria, al menos para algunos laboratorios, y son bastante grandes individualmente, por lo que el impacto podría ser de decenas de miles de millones.
Estos ahorros de memoria podrían ser absorbidos por un mayor uso debido a la reducción de costos, sin duda (paradoja de Jevons), pero no está garantizado que el crecimiento del consumo siempre supere los ahorros...

Difusión de otras innovaciones: ¡la innovación principal de Kimi K3 no es solo KDA!
Kimi K3 elimina por completo la codificación posicional: Las codificaciones posicionales informan cuál es el número de secuencia de cada token en el contexto. Sus capas KDA, debido a su naturaleza recurrente, no necesitan codificaciones de posición. Las eliminan incluso para las capas MLA y no perjudica. ¿Beneficios? No requiere ningún esfuerzo especial para extender la longitud del contexto del modelo en comparación con modelos anteriores. Elegante.
Kimi K3 implementa residuos de atención a escala de 2.8T: Asegura, efectivamente, que las capas superiores puedan prestar atención selectiva a las entradas de las capas inferiores. En enfoques anteriores, las capas superiores no podían distinguir entre las entradas de las capas inferiores en una posición de token determinada, ya que todos los valores solían agregarse. Este nuevo enfoque le da al modelo una discernibilidad mucho mayor. (https://arxiv.org/pdf/2603.15031
Kimi K3 implementa el MoE Latente Estable de Nvidia: El principal beneficio de una arquitectura latente de Mezcla de Expertos (LatentMoE) estable es una mayor precisión del modelo y más capacidad de experto al mismo costo de inferencia o menor. Lo logra proyectando las representaciones de los tokens en un espacio latente más pequeño antes de realizar el enrutamiento y el cálculo de los expertos. Lo tomaron del artículo de Nvidia de enero de 2026 (https://arxiv.org/pdf/2601.18089v1

Con todas estas innovaciones juntas, el equipo de MoonShot logró una eficiencia de entrenamiento 2.5 veces mayor que su arquitectura anterior, Kimi K2. Es decir, logran la misma pérdida de validación con 2.5 veces menos FLOPs. ¡¡Esto es un ahorro masivo incluso para el cómputo de entrenamiento!! Esto permitirá que muchos más laboratorios entrenen modelos a tan gran escala con cómputo limitado...

Con K3, Moonshot desbloqueó nuevas leyes de escalado. Kimi K3 logra una ganancia de 2.5× en eficiencia de escalado sobre Kimi K2.
MoonShot también ha publicado como código abierto su kernel de GPU FlashKDA para el cálculo rápido del estado KDA y MoonMoE para el envío y combinación de tokens. Están bastante seguros de compartir tanto conocimiento, porque ya están trabajando en el próximo conjunto de innovaciones que los llevarán aún más lejos (al fin y al cabo, ellos también son capitalistas).

Las leyes de escalado no son leyes de la naturaleza, siempre podemos descubrir mejores
Además, podemos descubrir nuevas leyes de escalado con nuevas arquitecturas y paradigmas de entrenamiento, ofreciendo una inteligencia aún más densa. Las leyes de escalado son observaciones estadísticas, no son leyes de la naturaleza que no puedan cambiarse. Lo que esto significa es que con modelos más nuevos, para un tamaño más pequeño (y menor KV y estado) podemos tener un mejor rendimiento. Por lo tanto, la explosión de la demanda no significa ejecutar los mismos modelos grandes para siempre. Los modelos seguirán volviéndose más densos en términos de inteligencia.
Tenemos un ecosistema en forma de laboratorios chinos que es altamente restringido y altamente capaz - una combinación muy potente, como se discutió. Están descubriendo rincones del espacio de diseño que no han sido descubiertos por laboratorios con mejor financiación. Avanzan rápidamente debido al intercambio abierto de conocimiento. Esto evita que otros desperdicien sus esfuerzos reinventando la rueda. La evolución de la arquitectura ocurre mucho más rápidamente que de otra manera...
Además, este éxito del equipo de MoonShot seguramente inspirará a otros equipos igualmente capaces en DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED e incluso actores emergentes como Baidu, Ant Ling, Xiaomi Mimo, Meituan y muchos otros a ser los mejores, no solo como un modelo de código abierto, sino para ser los mejores en general.
También ocurrirán muchas innovaciones nuevas en laboratorios emergentes de Occidente, ya sea en xAI o MSL, ahora que han puesto orden y han comenzado a ofrecer grandes modelos.
Dicho esto, como sigo señalando, China tiene la mayor cantidad de jóvenes investigadores de IA según las estadísticas de NEURIPS. Las contribuciones en este campo provienen de manera desproporcionada de investigadores más jóvenes (el hilo fuente), por lo que es probable que surjan muchos más avances de esa parte del mundo.

China también tiene 3 grandes centros urbanos con una densidad de talento en IA que rivaliza con la del Valle del Silicio, que actúan como crisoles de mezcla de ideas (el hilo fuente).

Prohibir la IA de código abierto no ayudará:
Una conclusión desafortunada de esta discusión podría ser que debemos prohibir la IA de código abierto para proteger los mercados occidentales. Pero eso sería altamente contraproducente.
Ya sea que la IA de código abierto esté prohibida o no en el mundo occidental, estos espacios de diseño se explorarán y se publicarán artículos. Occidente también tiene muchos laboratorios nuevos y excelentes surgiendo. Descubrirán muchas ideas nuevas también, ahora que se ha dado cuenta de que aún son posibles muchas ganancias de eficiencia.
Lo mejor es fomentar y adoptar estas innovaciones, ser responsables con las inversiones y evitar la especulación salvaje.
El futuro es muy, muy brillante debido a esta tecnología, pero debemos tener cuidado de no ser especuladores locos que reciben una llamada de margen.
No hemos estado utilizando tanta IA como podríamos: ya sea en el mundo corporativo, la educación, la investigación o el entretenimiento.
- Si bien la codificación ha sido el pilar del uso de tokens de GenAI, aplicaciones como CoWorker apenas han comenzado.
- Me encantaría que cada estudiante en India tuviera acceso ilimitado a modelos de nivel Opus 4.8 o Kimi K3. Tienen acceso, pero solo a modelos más débiles.
- Además, podríamos tener casos de uso de IA de mucho mayor valor en Ciencia, Ingeniería y Medicina.
- También, tenemos un mundo que envejece y del que debemos cuidar. La IA será de gran beneficio allí. Existen muchas posibilidades también en el entretenimiento y los juegos. Como mencionó Jensen Huang: "cada píxel que vemos en la pantalla para entretenimiento será generado".
Conclusión:


El colapso del mercado de valores de 1929 - la Gran Depresión - no fue el resultado de la destrucción de la demanda. Fue el resultado de excesos especulativos. El mundo entero sufrió durante dos décadas. Se podría argumentar que condujo al ascenso del Fascismo y la Segunda Guerra Mundial.
Si bien el futuro es incierto, lo que está claro en mis observaciones es que los alcistas de la IA y de la memoria, en particular, no tienen en cuenta las innovaciones algorítmicas y el descubrimiento de nuevas leyes de escalado. Para ellos, todo es absorbido por la paradoja de Jevons, por lo tanto, no es interesante. Esta actitud se ha filtrado también a los inversores minoristas y ha llevado a un comportamiento insano que tiene el potencial de derrumbar las economías de varios países. Quiero introducir nuevos ángulos en su análisis. Tienen información mucho mejor sobre las situaciones de la cadena de suministro y las ganancias corporativas. Quiero armarlos con una perspectiva más técnica.
Para que se desplomen las acciones de memoria e IA, no necesitamos una reducción masiva de la demanda, como [ha señalado Jaya Gupta.](https://x.com/JayaGup10/status/2082301754872369331) Incluso una pequeña reducción de la demanda puede iniciar una competencia de teoría de juegos en la que los tenedores actuales comiencen a tomar ganancias con la intención de comprar acciones más tarde, esto puede colapsar todo el mercado. Y esto parece haber comenzado...
Es importante no dejar que se formen burbujas tan grandes y que estallen catastróficamente para la sociedad. En general, me mantengo muy optimista sobre el potencial de esta tecnología (e incluso la demanda de memoria) y la futura construcción de infraestructura. ¡Es la época más emocionante para estar vivo!
(NO ES UN ASESORAMIENTO DE INVERSIÓN)
Apéndice
Cálculo detallado de los ahorros de memoria:
Para mostrar lo bueno que es Kimi K3, le pedí al propio K3 que hiciera estos cálculos. He verificado que son correctos. Como se mencionó anteriormente, consideramos dos casos:
1) Kimi K3: 69 KDA + 24 Gated MLA de atención completa vs.
2) Full MLA: 93 MLA de atención completa








