**

Los Tres Carros de la IA China
Durante mucho tiempo, los modelos de inteligencia artificial china han seguido aproximadamente tres caminos.
El primer camino es el de ir deliberadamente a lo pequeño. Ejemplos de ello son minimax-m3, Kimi K2.5 e hy3, que limitan activamente los parámetros activados a unos 20B. Si 20B es realmente "pequeño" es una cuestión sutil, pero en términos de ingeniería, generalmente lo consideramos así.
Los parámetros activados más pequeños suelen ser una restricción económica dura. Maximizar el rendimiento dentro de estas limitaciones es una mentalidad típica de "modelo pequeño".
El segundo camino es DeepSeek, y los fabricantes con pilas técnicas y tamaños similares que surgieron después. La marca distintiva de la ruta DeepSeek no es solo ser completamente de código abierto, sino más importante aún, que DeepSeek-V3/R1 fueron modelos a gran escala desde el principio, comparándose con los modelos de primer nivel de OpenAI.
A medida que R1 explotó en popularidad, DeepSeek añadió una vasta pila técnica centrada en la eficiencia económica. Por lo tanto, la ruta DeepSeek se caracteriza por "alto rendimiento mientras se asegura una inferencia económica". GLM-5 es un sucesor y practicante sistemático de este camino, siendo GLM-5.2 uno de sus resultados más conocidos.
El tercer camino es Kimi. La pila técnica de Kimi siempre ha sido independiente y está lejanamente relacionada con DeepSeek. Mientras que la serie K2.5 a K2.7 absorbió significativamente la pila técnica de DeepSeek, la nueva serie K3 ha vuelto a su tecnología propietaria.
K3 ha llevado los parámetros totales a 2.8T, con parámetros activados estimados en 50B, utilizando tecnología completamente propia. La ley de escalado del tamaño ha surtido efecto, pero también ha provocado que la eficiencia económica de Kimi K3 caiga significativamente, entrando en el rango de precios de Claude Sonnet.
Aunque sigue siendo muy barato en comparación con Claude, los clústeres de inferencia de Kimi están ubicados dentro de China. Dadas las limitaciones en la cantidad de GPU, es probable que Kimi no priorizara la economía al construir K3.
En otras palabras, K3 es el producto de una pila técnica independiente, un tamaño masivo y una búsqueda sin cuartel del alto rendimiento.
A diferencia de los modelos en la ruta DeepSeek que equilibran rendimiento y economía, el objetivo de K3 desde el principio no fue hacer un mejor R1, sino compararse con los modelos ultra grandes de vanguardia de OpenAI y Anthropic.
¿Por Qué es K3 Tan Grande?
Describir a Kimi como una ruta técnica independiente nunca relacionada con DeepSeek no es del todo exacto.
El artículo de Kimi K2 dejó claro: K2 utilizaba una arquitectura MoE ultra dispersa y MLA similar a DeepSeek-V3. Ambos tienen 61 capas y expertos compartidos, con cada token activando 8 expertos enrutados. K2 mejoró esta base aumentando el número de expertos a 384, reduciendo a la mitad los cabezales de atención, y utilizando MuonClip desarrollado internamente, recetas de datos, post-entrenamiento agéntico e infraestructura independiente para crear su propia bifurcación.
Por lo tanto, K2 era más como una rama de Kimi sobre un chasis estilo DeepSeek-V3 que una especie diferente desde cero.
Lo que realmente es notable es que el tamaño base de K2.5 a K2.7 no continuó expandiéndose: los parámetros totales se mantuvieron alrededor de 1T, los parámetros activados alrededor de 32B, todavía con 8 expertos seleccionados de 384.
En otras palabras, Kimi demostró que podía exprimir muchas generaciones del mismo chasis utilizando post-entrenamiento y sistemas de agentes sin expandir la base.
Pero K3 es diferente. K3 no es solo una actualización de versión rutinaria. Marca la decisión activa de Kimi de poner fin a la fase de "continuar el post-entrenamiento en una base existente" y volver a la expansión de escala de pre-entrenamiento.

K3 utiliza en gran medida tecnologías propietarias previamente dispersas, como su propia base de entrenamiento, mecanismo de atención y estructura de enrutamiento de expertos. En esta etapa, el parentesco de K3 con DeepSeek se ha vuelto bastante lejano.
K3 pretende demostrar dos cosas: primero, que Kimi puede definir su propio paradigma técnico; segundo, que Kimi está calificada para usar nueva tecnología para entrenar modelos ultra grandes completamente nuevos que compitan con OpenAI y Anthropic.
Como resultó, K3 lo logró.
De Servicio Público a Monopolio Privilegiado
Antes de DeepSeek, a China no le faltaban modelos utilizables, pero apenas eran funcionales.
La aparición de DeepSeek trajo por primera vez un modelo de alto rendimiento disponible en China, convirtiéndose en un servicio público para una generación de IA china. La misión central de un servicio público es la Adopción: cómo promover capacidades "buenas" a gran escala, especialmente en una base de inferencia que no es precisamente rica.
Por lo tanto, el papel de DeepSeek no fue solo un avance en rendimiento, sino también una pesada responsabilidad de optimización económica.
De V3 a V4, DeepSeek ha mantenido precios de API casi benéficos, respaldados por una pila técnica madura orientada a la optimización de la inferencia.
En esta etapa, el problema que enfrentaba la IA china era: primero satisfacer las necesidades de rendimiento del servicio público, luego reducir los costos computacionales de ese servicio.
Para los fabricantes chinos distintos de DeepSeek, la tarea se volvió doble: primero, el rendimiento debía alcanzar a R1, o el modelo no tenía posición competitiva; segundo, el precio, el rendimiento y la eficiencia de despliegue debían acercarse lo más posible a DeepSeek, o la adopción simplemente no ocurriría.
La transición por fases de la pila de GLM es el microcosmos más claro de esta presión industrial.
En este sentido, DeepSeek llevó a los modelos chinos a la fase de Adopción. La pregunta central de esta fase es: cómo permitir que más personas usen inteligencia suficientemente fuerte, y cómo manejar la consiguiente explosión en el volumen de llamadas.
Pero un laboratorio fronterizo debe eventualmente responder a otra pregunta: si solo buscas ser una versión más barata de otros, ¿de dónde vendrán los modelos de mayor rendimiento?
Todas las grandes empresas de internet tomaron una decisión: encontrar formas de eludir las prohibiciones e importar desde EE. UU. Por ejemplo, la famosa entidad de Alibaba en Singapur permitía a los usuarios ejecutar Claude Code mediante acceso remoto a máquinas en Singapur.
Luego fueron bloqueados. Si el Tío Sam no hubiera asestado rápidamente el golpe de 5.6 Sol, Dario podría haber publicado algunos artículos más pisoteando a los chinos.
A través de una extensa optimización de ingeniería, China ha ido comprendiendo gradualmente la base para el servicio público de la IA. Pero sin modelos fronterizos más grandes y de mayor rendimiento, siempre estará un paso atrás, cayendo en una "competencia privilegiada" desventajosa a largo plazo.
La Danza de la Espada de Xiang Zhuang: Apuntando Más Allá de la Superficie
Los 2.8T de K3 son la respuesta de Moonshot a este problema.
K2.5 a K2.7 aún pueden entenderse como la mejora de la relación costo-rendimiento en una base de 1T-A32B mediante pre-entrenamiento continuo, RL, entornos de herramientas y sistemas de agentes.
K3, sin embargo, empuja la capacidad total directamente a 2.8T, aceptando requisitos de despliegue de más de 64 tarjetas de aceleración y elevando los precios de API de $0.95/$4 de K2.7 Code a $3/$15. Aunque este precio solo es comparable a Sonnet, sigue siendo muy caro.
La clave son las 64 tarjetas de aceleración. ¿Dónde vas a encontrar tantos nodos de 64 tarjetas en los clústeres de inferencia de China?
K3 podría aún esperar mantener la economía, pero eso es casi imposible para K3. Un modelo gigante de 2.8T es una gran prueba incluso para las empresas de inferencia estadounidenses. Por lo tanto, la intención de K3 claramente no es la adopción generalizada, sino abrir un estándar de modelo que pueda ser ampliamente adoptado en los campos de batalla más punteros.
En comparación con la mayoría de los artículos de relaciones públicas que afirman aplastar a los modelos estadounidenses, las palabras oficiales de Kimi son más moderadas: K3 en general sigue rezagado respecto a Fable 5 y GPT-5.6 Sol.
Por supuesto, desde otra perspectiva, es muy agresivo: solo está ligeramente por detrás de los modelos de primer nivel de OpenAI y Anthropic.
Una vez que entra en este grupo, K3 primero desestabiliza la narrativa comercial más importante de Anthropic del año pasado.
La Historia del Movimiento Perpetuo de Anthropic
La metodología de Anthropic siempre ha sido clara: creamos un modelo irremplazable, y una vez que los usuarios descubren que puede completar tareas que otros modelos no pueden, estarán dispuestos a pagar una prima por un mayor rendimiento.
Fable 5 es el producto más extremo de esta metodología. Se dirige a los trabajos de conocimiento más difíciles, codificación y tareas asíncronas complejas que pueden durar días, con precios de API de $10 por millón de tokens de entrada y $50 por millón de tokens de salida, el doble del precio regular de Opus 4.8.
Anthropic no está vendiendo tokens más caros; está vendiendo un nuevo intervalo de tareas: proyectos que antes no podían completarse de manera estable ahora pueden ser manejados por Fable. En estos escenarios, Fable tiene un valor irremplazable.
Mientras exista esta irremplazabilidad, la prima de precio es perfectamente razonable. Después de todo, los modelos de alto rendimiento reemplazan la mano de obra de alto conocimiento, y el salario de esta última es mucho más caro que el modelo.
Tras el lanzamiento de Fable, el mercado brevemente formó la ilusión de que OpenAI ya no podía alcanzar a Anthropic. La proyección súper alcista de SemiAnalysis incluso estimó que el ARR de Anthropic podría alcanzar los $300 mil millones para finales de 2027, con un valor empresarial de $6 billones a un múltiplo de 20x ARR.
Esta predicción se basó en un conjunto de suposiciones: API representando el 75%–85% de los ingresos, altos márgenes brutos de API, retención neta de ingresos extremadamente alta y penetración continua de Claude Code.
Desde la perspectiva del 18 de julio, parecía que SemiAnalysis estaba alucinando. Pero el 8 de julio, muchos lo encontraron bastante plausible.
La realidad preparó una línea de tiempo altamente dramática para esta narrativa. La proyección de valoración de $6 billones circuló ampliamente el 8 de julio, y GPT-5.6 Sol se lanzó oficialmente el 9 de julio.
La historia del movimiento perpetuo de Anthropic duró menos de un mes antes de ser derribada. Durante ese tiempo, también se lanzaron algunos artículos criticando la destilación de los modelos chinos.
¿Quién Mató a Cock Robin?
Tras el lanzamiento de GLM-5.2, escribí un análisis sistemático de su significado, que fue aclamado por el público como una "obra maestra".
Considerando que Zhipu nunca me ha pagado por promoción, sigo siendo un investigador independiente (risas).
Sin embargo, GLM-5.2 sí sacudió los cimientos de Anthropic; la gente simplemente no se dio cuenta de la gravedad de la situación en ese momento.
GLM-5.2 tiene un rendimiento superior a Opus 4.8 en la mayoría de las tareas, solo superado por Opus 4.7. Has leído bien: mejor que 4.8 mientras es solo superado por 4.7, lo que hace preguntarse cuánta agua diluyó Anthropic en 4.8.
Mientras tanto, el precio de GLM-5.2 es solo una quinta parte del de Opus, y no sufre los problemas de limitación de tasa de los planes de suscripción de Anthropic. La aparición de GLM-5.2 ya ha amenazado significativamente el ancla de precios del segmento de modelos principales de Anthropic.
Como resultado, el mercado esperaba valorar a Anthropic por "modelos más punteros", lo que llevó a la predicción de valoración de $6 billones de SemiAnalysis.
Inmediatamente después, Sol chocó de frente con Fable en el nivel de capacidad más alto. Anthropic posteriormente extendió los límites de suscripción de Fable varias veces y finalmente anunció que se convertiría en un beneficio permanente para Max y Team Premium.

Luego salió K3. Su capacidad integral está por detrás de Fable y Sol, y solo por detrás de Fable y Sol. Mientras tanto, K3 es de código abierto, y cualquier clúster de inferencia puede desplegarlo.
Niños, los modelos avanzados de IA realmente crecen en los campos.
Competencia Asimétrica
En el pasado, la lógica de los controles de chips de computación avanzada de EE. UU. sobre China era directa: ralentizar el entrenamiento de modelos fronterizos de China y la construcción de un ecosistema de semiconductores independiente limitando la capacidad de cómputo ascendente. La seguridad nacional, los usos militares y de vigilancia eran las razones legales públicas, mientras que mantener el liderazgo de EE. UU. en tecnologías clave era un objetivo industrial concurrente.
Por supuesto, el problema mayor era que los propios chips avanzados de EE. UU. no eran suficientes. EE. UU. no solo estaba preocupado por que China obtuviera capacidad de cómputo, sino que tampoco quería que las empresas chinas participaran en licitaciones, desplazando la capacidad de compra de tarjetas de los laboratorios y centros de datos estadounidenses.
Estos controles ciertamente aumentaron la dificultad para que China entrenara modelos fronterizos, pero también crearon un sutil efecto contrario: privaron a las empresas chinas de IA de la capacidad de obtener ganancias excesivas, mientras que simultáneamente convirtieron esta desventaja en un arma en el juego.
Ya que no me dejas ganar ganancias excesivas, y no quiero que mi tecnología sea bloqueada, simplemente la regalaré una vez que la haga.
Y los modelos de código abierto no son exigentes con las tarjetas gráficas. Las tarjetas chinas pueden desplegarlos, y los clústeres de cómputo estadounidenses también. Fireworks, TogetherAI y un montón de NeoClouds tienen muchas GPU.
Por lo tanto, ha surgido una combinación altamente abstracta en la competencia de IA entre EE. UU. y China:
Modelos Chinos + Clústeres de Inferencia de EE. UU. y Globales VS Laboratorios de IA de Código Cerrado de EE. UU.
Los laboratorios chinos asumen la costosa I+D de modelos, intercambiando pesos abiertos por adopción y estatus fronterizo; los proveedores de nube y plataformas de inferencia de EE. UU. utilizan GPU locales para manejar las llamadas, fijando precios basados en el costo y obteniendo grandes ganancias.
Quienes realmente pierden ganancias son los laboratorios fronterizos de EE. UU. que dependen de pesos cerrados y escasez de capacidad para cobrar precios premium.
Para los laboratorios chinos, sacrificar pesos abiertos significa perder la posible renta de API que ya estaba limitada por su propia capacidad de inferencia.
Para los laboratorios cerrados de EE. UU., lo que se sacrifica es la ganancia excesiva real construida sobre abundante poder de cómputo local y escasez de capacidad global.
Por lo tanto, EE. UU. enfrenta no una simple elección de "continuar sanciones o abrir ventas", sino una trinidad imposible:
- Sancionar a China, y China continuará lanzando modelos de código abierto, así que nadie gana dinero.
- Dejar que China compre tarjetas, y la licitación colectiva podría dejar a los laboratorios locales con pocas tarjetas.
- Darle a China algunas tarjetas de manera apropiada para lograr un compromiso, pero ¿cuántas son apropiadas? Nadie lo sabe, y nadie se atreve a hablar.
Esto es competencia asimétrica típica. A Washington le encanta hablar de competencia asimétrica; ahora el término ha vuelto para perseguir a Washington.
¡Lealtad a Micron!
Llevar esta cadena un paso más arriba toca toda la narrativa de CapEx de IA.
En el pasado, los altos márgenes brutos de inferencia de los modelos fronterizos de código cerrado eran el colchón más importante para la cadena de CapEx de IA. Mientras las capacidades del modelo fueran escasas, las API y suscripciones podían mantener precios altos; los laboratorios y proveedores de nube obtenían altos márgenes brutos, permitiéndoles tolerar GPU más caras, una depreciación más rápida e inversiones en centros de datos más agresivas; los proveedores ascendentes continuarían entonces expandiendo la producción y manteniendo precios altos.
Esta cadena puede escribirse simplemente como:
Escasez de Capacidad del Modelo → Precios Altos de API → Márgenes Brutos Descendentes Altos → Capacidad de Soportar Primas de GPU → Expansión de CapEx → Prosperidad Continua Ascendente.
Cuando múltiples plataformas pueden desplegar el mismo peso, los precios de inferencia pasan de "cuánto está dispuesto a cobrar el laboratorio fronterizo" a "cuánto le cuesta a un clúster eficiente ejecutar una tarea exitosa".
Los pesos abiertos no cambian el hecho de que el poder de cómputo cuesta dinero; eliminan el "impuesto al modelo" adjunto al consumo de cómputo. Fireworks no tiene que soportar los costos de pre-entrenamiento de K3 para Moonshot, ni tiene que pagar un alquiler completo del modelo a un modelo de código cerrado aguas arriba por token.
Todavía tiene que soportar los costos de GPU, motores de inferencia, cuantificación, almacenamiento en caché, redes, financiamiento, SLAs y ventas empresariales, pero solo necesita cotizar basándose en los costos reales de cómputo, utilización, costos de servicio y ganancia competitiva. Esta es una lógica de fijación de precios basada en costos típica, y para una industria que depende de la prosperidad, la fijación de precios basada en costos tiene un impacto desastroso en el sector ascendente.
Esto cambiará inversamente el cálculo de retorno de capital para cada GPU.
En el pasado, los proveedores de servicios podían poner los costos de hardware caros en las API de modelos de alto precio y pasarlos a los clientes finales.
Cuando las plataformas de inferencia compiten en torno a los mismos pesos abiertos, se vuelve más difícil para cualquiera de ellas seguir pasando esta prima. Por lo tanto, la adquisición de GPU requiere una mayor utilización, períodos de recuperación más cortos, costos de financiamiento más bajos y contratos de clientes más seguros.
A corto plazo, los compradores descendentes más dispersos no debilitarán el poder de negociación de los productores de cómputo (especialmente NVDA). Pero a largo plazo, la disminución sistémica de los márgenes brutos descendentes inevitablemente conducirá a una peor elasticidad de negociación para el sector ascendente, lo cual es un riesgo incontrolable y enorme para toda la narrativa de CapEx de IA.
Demasiado Grande para Fracasar
En este punto, los 2.8T de K3 han revelado dos significados aparentemente contradictorios.
Por un lado, K3 no es un modelo muy económico, empujando los modelos al rango de precios de Sonnet y al grupo de despliegue de 64+ tarjetas.
Por otro lado, es precisamente esta "no priorización de la economía" lo que califica a K3 para entrar en el grupo de mayor capacidad, desestabilizar la renta del modelo de Anthropic, reestructurar las ganancias de inferencia entre EE. UU. y China, e influir en la narrativa de CapEx de IA.
En el pasado, a muchas empresas les gustaba hablar de lado del borde, tamaños pequeños y "suficientemente bueno". Estas rutas son ciertamente importantes; determinan hasta dónde puede extenderse la inteligencia existente a dispositivos, usuarios e industrias.
Pero el término "suficientemente bueno" es muy aburrido; solo se aplica a mercados donde los límites de capacidad ya están fijos.
La IA fronteriza nunca enfrenta un conjunto fijo de tareas: un modelo que acaba de aprender a programar archivos individuales hoy tendrá que manejar bases de código completas mañana; uno que acaba de aprender a llamar a herramientas tendrá que trabajar de forma continua durante horas o incluso días en la próxima generación.
Los modelos de tamaño moderado responden a "cómo ser usados por más personas", mientras que los modelos más grandes compiten por "quién tiene el derecho de entregar el oráculo".
Un modelo que ya es fuerte pero caro puede luego hacerse más rápido y más barato mediante dispersión, cuantificación, almacenamiento en caché, destilación e ingeniería de inferencia; también puede servir como modelo maestro para toda una línea de modelos pequeños.
Un modelo pequeño que no aprendió una cierta capacidad desde el principio, sin embargo, es difícil de suplementar de la nada a través de pensamiento extendido u optimización de despliegue.
Esta asimetría hace que "ir a lo grande para no perder" sea una metodología fronteriza cruda pero a menudo efectiva.
En 2024, OpenAI lanzó o1, cambiando el enfoque del escalado de bases de pre-entrenamiento más grandes a aprendizaje por refuerzo en tiempo de entrenamiento y cómputo de pensamiento en tiempo de prueba.
o1 en sí mismo es un modelo de inferencia más pequeño. Demostró que "base más pequeña + más pensamiento" puede crear un progreso asombroso en matemáticas, código y razonamiento formal, iniciando así un ciclo de hacer los parámetros más pequeños.
Cuanto más pequeña la base, más depende de la compensación de cómputo en tiempo de prueba; cuanto más exitosos los trucos de inferencia, menos motivación tiene la organización para expandir la base. En consecuencia, los modelos de OpenAI comenzaron a deteriorarse rápidamente.
En 2025, Anthropic fue por el camino opuesto. Anthropic insistió en hacer modelos más grandes y más caros, luego usó Claude Code para convertir capacidades en productos.
La lealtad de los usuarios a Claude no es porque sea barato, sino porque en las tareas de ingeniería de software del mundo real más difíciles, se sienten más seguros al darle el trabajo a Opus. A finales de 2025, Anthropic afirmó que Claude Code ocupaba más de la mitad del mercado de codificación de IA, con su cuota de mercado empresarial aumentando del 24% al 40%. Los ingresos también superaron a los de OpenAI.
OpenAI posteriormente se dio cuenta de que la eficiencia de inferencia y el enrutamiento no pueden reemplazar la base de mayor capacidad. GPT-5 restableció una escalera completa de principal, pensamiento, mini y Pro; para GPT-5.6, claramente estableció tres tamaños de modelo—Sol, Terra y Luna—y colocó a Sol a gran escala de vuelta en la posición insignia para los trabajos más difíciles.
Como resultado, los usuarios de Codex superaron rápidamente los 10 millones, obligando a Anthropic a añadir Fable de vuelta a sus planes de suscripción.
Ahora, se lanza K3, solo superado por Sol y Fable, incluso provocando debates sobre si la IA fronteriza de EE. UU. sigue siendo suficiente para la tarea.
Cuando realmente estás dispuesto a competir por el primer lugar, el resultado generalmente no es malo. Esto es Demasiado Grande para Fracasar.
Conclusión: Jóvenes de Pueblo Golpeando a Capitalistas
Las empresas chinas de modelos de IA a menudo son descritas como jóvenes de pueblo: recursos limitados, mala ubicación, una reputación internacional aún peor, y afortunadas si sus GPU pueden mantener la inferencia, y mucho menos el entrenamiento, siempre que no se queden atrás.
Mientras tanto, los laboratorios avanzados de IA de EE. UU. tienen un aire capitalista: discutiendo antropología y seguridad, discutiendo máquinas benevolentes, discutiendo si el mundo futuro pertenece a la libertad o a la falta de libertad, si la IA pertenece a la tierra o al cielo.
Bajo una brecha tan dramática, una obra donde los jóvenes de pueblo golpean a los capitalistas puede realmente escenificarse. No importa cómo lo mires, es suficiente para reírse a carcajadas.
—En realidad, no hay que apresurarse. Lo mejor está por venir.





