Esta fue mi primera entrevista con Yang Zhilin, realizada a principios de 2024 y publicada el 1 de marzo de 2024, exactamente en el primer aniversario de la fundación de Kimi. En ese entonces, Kimi solo tenía 80 personas, trabajando en su primera oficina, algo deteriorada. No había logotipo en la entrada. Solo un piano blanco vigilaba la puerta.
Este artículo generó bastante revuelo en la comunidad tecnológica china en ese momento.
En ese entonces, yo todavía era periodista de prensa escrita, por lo que esta entrevista solo existe como texto y un podcast de audio.
Como podemos ver, muchas de las opiniones expresadas en este artículo se han cumplido desde entonces.
¡Solo con releer estas palabras de hace dos años, no puedes evitar maravillarte de cómo ha cambiado el mundo drásticamente!
(Esta traducción fue generada por Kimi K3.)
Yang Zhilin: "Si todos piensan que eres normal, si tu sueño es uno que cualquiera podría tener, no suma nada al total de los sueños de la humanidad."
Por Zhang Xiaojun
Hace solo un año, el científico de IA Yang Zhilin hizo un cálculo preciso en Silicon Valley. Se dio cuenta de que si decidía lanzar una startup de modelo fundacional orientada a la AGI, necesitaría recaudar más de 100 millones de dólares en los próximos meses.
Sin embargo, eso era solo un boleto de entrada al juego. Un año después, esa cifra se había multiplicado por trece.
Para las empresas de modelos fundacionales, la competencia es menos una contienda científica que, ante todo, una brutal contienda de dinero. Con los inversores apretando sus bolsillos, debes adelantarte a tus rivales para recaudar más dinero, comprar más GPUs y captar más talento.
"Requiere una concentración de talento y una concentración de capital", dice Yang Zhilin, fundador y CEO de Moonshot AI, la empresa de modelos fundacionales establecida el 1 de marzo de 2023.
Durante el año pasado, las empresas chinas de modelos fundacionales han parecido vivir al borde de una supervivencia tensa y restringida. En la superficie, cada una tiene grandes sumas de efectivo. Pero, por un lado, deben invertir inmediatamente el dinero recién recaudado en investigación extremadamente costosa para alcanzar a OpenAI—primero alcanzando a GPT-3.5, y antes de siquiera llegar a GPT-4, aparece Sora. Por otro lado, deben competir sin cesar para encontrar casos de uso viables en el mundo real, para validar por sí mismas que son empresas, no institutos de investigación que solo devoran capital. Y eso no es suficiente: para cada una de estas empresas, ya sea que la salida sea una OPI o una adquisición, el camino sigue siendo todo menos claro.
Entre los fundadores de las empresas de modelos fundacionales de China, Yang Zhilin es el más joven, nacido en 1992. La industria lo describe como un firme creyente de la AGI y un fundador con un carisma técnico poco común. Gran parte de su historial académico y profesional está vinculado a la IA de propósito general, y sus artículos han sido citados más de 22,000 veces.
A mediados de 2023, la comunidad tecnológica china pasó abruptamente de la euforia al desánimo con respecto a los modelos fundacionales, y la aceleración de la implementación en el mundo real se convirtió en la melodía principal pragmática. Esto inevitablemente dejó a los CEOs de modelos fundacionales divididos violentamente entre el ideal y la realidad. En un ecosistema de IA chino donde todos corean PMF (product/market fit) y todos corean comercialización, este fundador—un investigador de IA de formación—no tiene ninguna prisa en particular.
Con 80 personas, Moonshot AI tiene la plantilla más pequeña entre las principales empresas de modelos fundacionales de China. A diferencia de sus rivales, Yang no optó por el negocio B2B más seguro ni buscó implementación en verticales como la salud o los videojuegos. Construyó uno—y solo uno—producto de consumo: el asistente de IA Kimi, que acepta entradas de hasta 200,000 caracteres chinos. Kimi es también el nombre en inglés de Yang Zhilin.
Yang prefiere ver su empresa como un sistema que combina ciencia, ingeniería y negocios. Podrías imaginarlo así: por encima del mundo humano, él está erigiendo un banco de laboratorio de IA—con una mano realiza experimentos, y con la otra lleva la tecnología de vanguardia al mundo real, descubriendo aplicaciones a través de la interacción con las personas y entregando esas aplicaciones a los consumidores. Idealmente, lo primero quema miles de millones y decenas de miles de millones de dólares de capital; lo segundo gana ese dinero cientos o miles de veces. Como lo oigas, suena tan emocionante—y tan peligroso—como caminar sobre la cuerda floja.
"La IA no se trata de qué PMF puedo encontrar en el próximo año o dos; se trata de cómo cambiar el mundo en los próximos diez a veinte años", dice.
Un pensamiento tan abstracto e idealista hace que uno sude nerviosamente por él: ¿puede un joven científico de IA abrirse un espacio para sobrevivir en una China realista?
En febrero de 2024, Moonshot AI cerró una gran ronda de financiación contra la corriente del mercado. Se sabe que la empresa recaudó una Serie B de más de mil millones de dólares con una valoración pre-money de 1.5 mil millones de dólares, liderada por Alibaba con la participación adicional de Monolith Management, Xiaohongshu y otros. Al completar el acuerdo, la valoración post-money de Moonshot AI era de aproximadamente 2.5 mil millones de dólares—convirtiéndola, en esta etapa, en el unicornio más valorado en la carrera de modelos fundacionales de China. (La empresa se negó a responder o comentar sobre el asunto.)
En medio de esta tercera ronda de financiación, nos sentamos con Yang Zhilin para hablar sobre su primer año de emprendimiento—una sección transversal, en miniatura, de un año en el que las empresas chinas de modelos fundacionales se aceleraron desde la línea de salida.
Su empresa no se instaló en Soho Network Plaza en Beijing, el centro donde se agrupan las empresas de modelos fundacionales. Para una empresa con una financiación total de aproximadamente 9 mil millones de RMB, esta oficina en el edificio Liangzi Xinzuo parece tosca y deteriorada. Ni siquiera hay un logotipo de la empresa en la entrada, solo un piano blanco que vigila la puerta.
La sala de reuniones está en una esquina; con sus pequeñas ventanas, está oscura por dentro, y el calentador zumba mientras sopla aire caliente contra el frío invernal. En la tenue luz, Yang describe cómo le ha parecido el año pasado: "Es un poco como conducir por un camino con una cadena de montañas nevadas que se extienden al frente. No sabes lo que hay dentro. Solo sigues caminando hacia adelante, un paso a la vez."
A continuación se presenta la entrevista completa con Yang Zhilin. (Para facilitar la lectura, el autor ha hecho algunas ediciones textuales.)

Esta foto fue tomada a principios de 2024 en la primera oficina de Kimi en Beijing. Ya se han mudado de este lugar. No había logotipos en la entrada, solo un piano blanco que estaba tranquilamente junto a la puerta.
Parte 1
Parado al Principio
"Tienes que Montar la Ola"
Zhang Xiaojun: ¿Cómo has estado últimamente?
Yang Zhilin: Ocupado—hay muchas cosas. Pero todavía estoy emocionado. Estamos al principio de una industria, y hay un enorme espacio para la imaginación.
Zhang Xiaojun: Cuando entré hace un momento, vi un piano blanco puro en la entrada de tu empresa.
Yang Zhilin: También hay un álbum de Pink Floyd sobre él. No tengo idea de quién los puso allí—los noté de repente hace un par de días y no he tenido oportunidad de preguntar. (Pink Floyd es la banda de rock británica que lanzó el álbum The Dark Side of the Moon.)
Zhang Xiaojun: El día que se lanzó ChatGPT en noviembre de 2022, ¿qué estabas haciendo?
Yang Zhilin: Ya me estaba preparando para esto—reclutando personas, formando un equipo, intercambiando nuevas ideas. Ver ChatGPT fue emocionante. Tres a cinco años antes—incluso en 2021—habría sido inconcebible. Ese tipo de razonamiento de orden superior había sido muy difícil de lograr.
Sentí que muchas variables estaban a punto de cambiar en el mercado: el capital por un lado, el talento por el otro—los factores de producción centrales para la IA. Si esas variables se alineaban, sería posible construir una empresa adecuada para hacer esto—una organización construida para la AGI podría pasar de 0 a 1. Esa fue una gran revelación. Una empresa independiente tenía más sentido, pero no era algo que pudieras hacer en el momento que quisieras; ChatGPT sacudió las variables y unió los factores de producción. Tienes que montar la ola.
Zhang Xiaojun: Después de que decidiste fundar una empresa de AGI, ¿qué preparativos hiciste? ¿Cómo reuniste los dos factores de producción—capital y talento?
Yang Zhilin: Fue un proceso sinuoso. ChatGPT tardó en difundirse. Algunas personas se enteraron temprano, otras tarde; algunas dudaron al principio, luego se sorprendieron, luego se convirtieron en creyentes. Encontrar personas y encontrar dinero estaban estrechamente ligados al momento oportuno.
Comenzamos a enfocarnos en nuestra primera ronda de financiación en febrero de 2023. Si nos hubiéramos retrasado hasta abril, básicamente no habríamos tenido oportunidad. Pero hacerlo en diciembre de 2022 o enero de 2023 tampoco habría funcionado—la pandemia todavía estaba activa y la gente no lo había procesado aún. Así que la ventana real fue solo un mes.
Una noche en Estados Unidos, hice un cálculo preciso. Cuando terminé, concluí que necesitábamos recaudar al menos 100 millones de dólares en unos pocos meses. Muchos en el mercado aún no habían comenzado a recaudar fondos, y muchos no creían que pudieras recaudar tanto. Pero resultó ser posible—incluso más que eso.
El mercado de talento también comenzó a moverse. Inspirados por ChatGPT, muchos tuvieron esta realización en marzo o abril de 2023: esto es lo único que vale la pena hacer en la próxima década. Tienes que contactar a las personas adecuadas en el momento adecuado. Un año o dos antes, el talento no se habría agrupado en este grado. En ese entonces, más personas estaban haciendo IA tradicional o negocios relacionados con la IA—nada de eso era IA de propósito general.
Zhang Xiaojun: Para resumir: febrero fue la ventana para recaudar fondos, y marzo y abril fueron la ventana para contratar.
Yang Zhilin: Más o menos.
Zhang Xiaojun: Esa noche en EE. UU.—¿dónde estabas cuando hiciste estos cálculos? ¿Cómo lo calculaste exactamente?
Yang Zhilin: Desde finales de 2022 hasta principios de 2023, pasé uno o dos meses en EE. UU., hablando con gente. Lo hice donde estaba viviendo. Calculas cuántos FLOPs necesitas, el costo de entrenamiento, la inferencia y el número de usuarios.
Zhang Xiaojun: En ese momento, ¿cuál era el estado de ánimo predominante en Silicon Valley?
Yang Zhilin: El producto comenzó a atraer a muchos usuarios tempranos, concentrados en el círculo tecnológico. Nosotros estábamos en ese círculo, así que lo sentimos más intensamente. En las grandes empresas de Silicon Valley, la gente tiene que escribir evaluaciones de desempeño cada seis meses, y muchos comenzaron a escribirlas con ChatGPT. Algunas personas cuya escritura normalmente no era tan profesional entregaron evaluaciones escritas con ChatGPT, y todos sonaban muy serios.
Había corrientes subterráneas en movimiento. Mucha gente estaba pensando en su próximo trabajo o en comenzar una empresa. Bastantes amigos que hablaron con nosotros luego se fueron a fundar startups. Y había un intenso FOMO—miedo a perderse algo. Nadie podía dormir. Ya fuera medianoche, la 1 a.m. o las 2 a.m., si contactabas, la gente siempre estaba allí. Un poco ansiosos, un poco con FOMO, y muy emocionados.
Zhang Xiaojun: La noche que calculaste que necesitabas recaudar 100 millones de dólares—¿hasta qué hora te quedaste despierto?
Yang Zhilin: Estaba bien—el cálculo en sí no tomó mucho tiempo. Pero después, no podía decírselo a mucha gente. Si lo hubiera hecho, nadie habría creído que se pudiera hacer.
Parte 2
Linaje Técnico
"Libérate de la Talladura Interminable"
Zhang Xiaojun: Cuando el mundo del capital de riesgo habla de ti, dicen: "El fundador es brillante, tiene carisma técnico, y el equipo está lleno de estrellas técnicas". Entonces, antes de discutir tu empresa de modelos fundacionales, me gustaría comenzar con tu formación académica. Estudiaste ciencias de la computación en Tsinghua como universitario y obtuviste tu doctorado en la Escuela de Ciencias de la Computación de Carnegie Mellon. ¿La IA siempre ha sido tu enfoque?
Yang Zhilin: Nací en 1992 y comencé mi carrera universitaria en 2011. Desde mi segundo año hasta ahora—más de una década—he estado en este campo. Al principio exploré de manera más divergente, mirando por todas partes; hice algún trabajo relacionado con gráficos y con multimodalidad. En 2017, me centré en los modelos de lenguaje. En ese momento sentí que los modelos de lenguaje eran un problema relativamente importante; luego llegué a sentir que era el único problema importante.
Zhang Xiaojun: En 2017, ¿cómo entendía generalmente la industria de la IA los modelos de lenguaje, y cómo evolucionó esa comprensión?
Yang Zhilin: En ese entonces era un modelo utilizado para clasificar los resultados del reconocimiento de voz. (Risas.) Después de que se reconocía un segmento de voz, se obtenían muchos resultados candidatos, y se usaba el modelo de lenguaje para ver cuál tenía la mayor probabilidad y generar el más probable. Sus aplicaciones eran muy limitadas.
Pero te das cuenta de que es un problema fundamental, porque estás modelando las probabilidades del mundo. El lenguaje es limitado, pero es una proyección del mundo; en teoría, si haces el espacio de tokens—el espacio de todos los tokens posibles—lo suficientemente grande, puedes construir un modelo de mundo general. Cómo surge y se desarrolla todo en el mundo se puede asignar una probabilidad. Cada problema se puede reducir a cómo estimar probabilidades.
Zhang Xiaojun: Tus mentores académicos son muy prominentes: tus asesores de doctorado fueron Ruslan Salakhutdinov, jefe de IA en Apple, y William W. Cohen, científico jefe de Google AI. Ambos se mueven entre la industria y la academia.
Yang Zhilin: En años anteriores, la industria y la academia se unían más, pero la tendencia ahora está cambiando: los avances más valiosos ocurrirán en la industria. Esa es una ley inevitable del desarrollo. Comienza con investigación exploratoria y gradualmente se desplaza hacia un proceso de industrialización más maduro. Eso no significa que la investigación sea innecesaria durante la industrialización—solo que la investigación pura tendrá dificultades para producir avances valiosos.
Zhang Xiaojun: ¿Qué aprendiste de estos renombrados mentores?
Yang Zhilin: Lo que más aprendí fue en Google, donde hice una pasantía larga. Comencé a trabajar en modelos de lenguaje basados en Transformer a finales de 2018. Mi mayor aprendizaje fue liberarme de la "talladura" interminable—el refinamiento obsesivo de los detalles superficiales. Eso fue crucial.
Deberías mirar cuál es la gran dirección, el gran gradiente. Cuando tienes diez caminos por delante, la persona promedio se preocupa por cómo frenar para un peatón que está adelante en este camino—detalles a corto plazo. Pero cuál de los diez caminos tomar es lo que más importa.
Este campo tenía exactamente ese problema. Por ejemplo, en un conjunto de datos de solo uno o dos millones de tokens, mirarías cómo bajar la perplejidad, cómo bajar la pérdida, cómo mejorar la precisión—y caerías en una talladura interminable. La gente inventó muchas arquitecturas extrañas; estos eran trucos de talladura. Después de tallar, podrías hacerlo mejor en ese tipo de conjunto de datos, pero te pierdes la esencia del problema.
La esencia es analizar lo que le falta al campo. ¿Cuál es el primer principio? ¿Por qué la ley de escalado puede servir como un primer principio? Solo necesitas encontrar una estructura que satisfaga dos condiciones: primero, que sea suficientemente general; segundo, que sea escalable. General significa que puedes modelar todos los problemas dentro de este marco; escalable significa que mientras le des suficiente poder de cómputo, sigue mejorando.
Este es el pensamiento que aprendí en Google: si algo se puede explicar con algo más fundamental, no debes tallar en exceso en las capas superiores. Hay una línea importante con la que estoy muy de acuerdo: si puedes resolver un problema con escala, no lo resuelvas con un nuevo algoritmo. El mayor valor de un nuevo algoritmo está en cómo te permite escalar mejor. Cuando te liberas de la talladura, puedes ver mucho más.
Zhang Xiaojun: ¿Google también era un seguidor de la ley de escalado en ese entonces? ¿Cómo implementó el pensamiento de primeros principios?
Yang Zhilin: Muchas de esas ideas ya existían allí, pero Google no las implementó especialmente bien. Tenía esta forma de pensar, pero no podía organizarse en un verdadero moonshot. Era más como: aquí hay cinco personas persiguiendo mis primeros principios, y allá cinco personas persiguiendo los suyos. No había nada de arriba hacia abajo.
Zhang Xiaojun: Durante tu doctorado, publicaste artículos en colaboración con los ganadores del Premio Turing Yann LeCun y Yoshua Bengio—y fuiste el primer autor en esos artículos. ¿Cómo surgieron esas colaboraciones? Lo que quiero decir es: ellos son laureados con el Premio Turing y no eran tus asesores—¿en qué te basaste para atraerlos?
Yang Zhilin: La academia es muy abierta. Siempre que tengas una buena idea y un problema significativo, está bien. Lo que producen dos cerebros—o n cerebros—es más que un solo cerebro. Esto también se aplica al desarrollar AGI. Una estrategia importante en IA se llama "ensamblaje"—usar múltiples modelos o métodos diferentes y combinar sus predicciones para un mejor rendimiento. Esencialmente es hacer lo mismo: cuando tienes puntos de vista diversos, puedes generar muchas cosas nuevas. La colaboración es enormemente beneficiosa.
Zhang Xiaojun: ¿Primero tendrías una idea y luego les preguntarías si estaban interesados?
Yang Zhilin: Más o menos así fue.
Zhang Xiaojun: ¿Qué es más difícil: convencer a los pesos pesados académicos en la investigación, o convencer a los pesos pesados del capital en la recaudación de fondos? ¿Cuáles son las similitudes?
Yang Zhilin: "Convencer" no es una buena frase—la esencia detrás de esto es la cooperación. Cooperación significa que ambas partes ganan, porque el beneficio mutuo es la condición previa para la cooperación. Así que realmente no hay diferencia: necesitas ofrecer a otros un valor único.
Zhang Xiaojun: ¿Cómo te ganas su confianza? ¿Cuál crees que es tu don?
Yang Zhilin: No hay ningún don en particular—solo trabajar duro.
Parte 3
El Sistema Antiguo Ya No Funciona
"La AGI Necesita un Nuevo Tipo de Organización"
Zhang Xiaojun: Acabas de decir que "los avances más valiosos ocurrirán en la industria"—¿eso incluye las startups y los laboratorios de IA de los gigantes?
Yang Zhilin: Los laboratorios son historia. Google Brain solía ser el laboratorio de IA más grande de la industria, pero era una organización de investigación incrustada dentro de una gran empresa. Ese tipo de organización puede explorar nuevas ideas, pero es muy difícil que produzca un gran sistema—podría producir el Transformer, pero no pudo producir ChatGPT.
La forma en que evoluciona el desarrollo ahora es que estás construyendo un sistema enorme, que requiere nuevos algoritmos, ingeniería sólida, e incluso mucho trabajo de producto y comercialización. Es como a principios de la década de 2000: no podías investigar la recuperación de información en un laboratorio; tenía que vivir en el mundo real, como un gran sistema, un producto con usuarios—como Google. Así que los sistemas de investigación y educación cambiarán su función hacia la formación de talento principalmente.
Zhang Xiaojun: ¿Cómo describirías esta nueva forma de sistema? ¿Es OpenAI su prototipo?
Yang Zhilin: Es la organización más madura de este tipo hoy en día, y todavía está evolucionando gradualmente.
Zhang Xiaojun: Entonces, ¿se puede entender como una organización establecida para los grandes objetivos científicos de la humanidad?
Yang Zhilin: Quiero enfatizar: no es ciencia pura—es una combinación de ciencia, ingeniería y negocios. Tiene que ser una organización comercial, una empresa, no un instituto de investigación. Pero esta empresa se construye de cero a uno, porque la AGI necesita un nuevo tipo de organización. Primero, el modo de producción difiere de la era de internet; segundo, se desplaza de la investigación pura a una combinación de investigación, ingeniería, producto y negocios.
En su núcleo, debería ser un programa moonshot, con una gran cantidad de planificación de arriba hacia abajo—sin embargo, dentro de esa planificación hay espacio para la innovación, porque no toda la tecnología está predeterminada. Existen elementos de abajo hacia arriba dentro de un marco de arriba hacia abajo. Tal organización no existía antes, pero la organización debe adaptarse a la tecnología, porque la tecnología determina el modo de producción; si no coinciden, no puedes producir de manera efectiva. Creemos que muy probablemente necesitará ser rediseñada desde cero.
Zhang Xiaojun: Durante el golpe de la sala de juntas de OpenAI el año pasado, una opción para Sam Altman era unirse a Microsoft y liderar un nuevo equipo de Microsoft AI. ¿Cuál es la diferencia esencial entre eso y ser CEO de OpenAI?
Yang Zhilin: Tendrías que hacer crecer una nueva organización dentro de una cultura antigua—y eso es extremadamente difícil.
Zhang Xiaojun: Quieres construir "el OpenAI de China"—¿podemos decirlo así?
Yang Zhilin: No es del todo exacto. No queremos ser el "algo" de China, y no necesariamente queremos ser OpenAI.
Primero, la AGI real definitivamente será global. No existe tal cosa—al menos no a largo plazo—como una empresa de AGI confinada a algún mercado regional debido a mecanismos de protección del mercado. La globalización, la AGI y tener un producto con una base de usuarios muy grande: estas tres son, en última instancia, condiciones necesarias.
Segundo, ¿debería ser OpenAI? Si miras 2017–2018, OpenAI tenía una reputación terrible. Cuando la gente de nuestro círculo buscaba trabajo, generalmente consideraban lugares como Google. Muchas personas que hablaron con Ilya Sutskever, el científico jefe de OpenAI, se fueron pensando que el hombre estaba loco y era demasiado engreído—OpenAI era o locos o estafadores. Pero se comprometieron muy temprano, encontraron el no-consenso, y encontraron lo que ahora es el único primer principio que funciona en IA: escalar a través de la predicción del siguiente token.
Creo que habrá una empresa más grande que OpenAI. Una empresa verdaderamente grande puede combinar el idealismo tecnológico con un gran producto, co-creando con sus usuarios—la AGI será, en última instancia, algo producido por el trabajo conjunto con todos sus usuarios. Así que no se trata solo de tecnología; también requiere pragmatismo y búsquedas en el mundo real—en última instancia, una combinación perfecta de ambos.
Aun así, debemos aprender del idealismo tecnológico de OpenAI. Si todos piensan que eres normal, si tu sueño es uno que cualquiera podría tener, no suma nada al total de los sueños de la humanidad.
Parte 4
El Primer Paso del Moonshot es "Contexto Largo"—¿Cuál es el Segundo?
"Dos Grandes Hitos Vienen a Continuación"
Zhang Xiaojun: Volviendo al momento en que decidiste comenzar la empresa—¿lanzaste la primera ronda de financiación inmediatamente después de regresar a China?
Yang Zhilin: Comenzó en EE. UU. en febrero (del año pasado), parte de forma remota. Al final, los inversores nacionales constituyeron la mayoría.
Zhang Xiaojun: ¿La primera ronda recaudó 100 millones de dólares?
Yang Zhilin: La primera ronda no fue tanto; las rondas posteriores superaron esa cifra. Completamos dos rondas en 2023, totalizando casi 2 mil millones de RMB.
Esta es ahora la tercera ronda. No hemos anunciado formalmente la financiación, así que no puedo comentar en este momento.
Zhang Xiaojun: Algunas personas dicen que desde la segunda mitad de 2023, nadie está dispuesto a invertir en empresas de modelos fundacionales. ¿Están equivocados?
Yang Zhilin: Todavía los hay. Puedes ver el cambio de sentimiento, pero no es que nadie esté invirtiendo—al menos por ahora, hay bastante interés de inversión en el mercado.
Zhang Xiaojun: Además del capital y las personas, ¿qué otras decisiones clave tomaste en 2023?
Yang Zhilin: Decidir qué hacer. Esa es la ventaja de empresas como la nuestra—tener una visión técnica para las decisiones en el nivel más alto.
Hacemos contexto largo. Eso requiere juicio sobre el futuro: necesitas saber qué es fundamental y hacia dónde se dirige todo a continuación. De nuevo, son los primeros principios—el proceso de "des-talladura". Si te enfocas en tallar, solo puedes mirar lo que OpenAI ya ha hecho y descubrir cómo reproducirlo.
Descubrirás que hacer compresión de texto largo sin pérdidas en Kimi le da al producto una experiencia única. Cuando lees artículos en inglés, te ayuda a entenderlos notablemente bien. Usando Claude o GPT-4 hoy, no necesariamente lo harás tan bien; esto requirió sentar las bases de antemano. Trabajamos en ello durante más de medio año. Eso es muy diferente de detectar una tendencia de contexto largo hoy, reunir apresuradamente dos equipos y desarrollarlo a máxima velocidad.
Por supuesto, el maratón apenas ha comenzado; vendrá más diferenciación, y eso requiere que usted anticipe de antemano lo que cuenta como "un no consenso que se mantiene válido".
Zhang Xiaojun: ¿En qué mes se tomó esta decisión?
Yang Zhilin: Febrero o marzo; se decidió tan pronto como se fundó la empresa.
Zhang Xiaojun: ¿Por qué el contexto largo es el primer paso del moonshot?
Yang Zhilin: Porque es fundamental. Es la memoria de la nueva computadora.
La memoria de la vieja computadora creció varios órdenes de magnitud durante las últimas décadas, y lo mismo ocurrirá con la nueva computadora. Puede resolver muchos de los problemas actuales. Por ejemplo, las arquitecturas multimodales actuales aún necesitan un tokenizer, pero con un contexto largo comprimido sin pérdidas, no se necesita uno; se puede poner la entrada bruta directamente. Llevado más allá, es la base para hacer que el nuevo paradigma computacional sea más general.
La vieja computadora podía representar todo con 0 y 1; todo podía digitalizarse. Pero la nueva computadora de hoy aún no puede; no hay suficiente contexto, por lo que no es tan general. Para convertirse en un modelo de mundo general, necesita contexto largo.
Segundo, permite la personalización. El valor central de la IA es la interacción personalizada; el valor finalmente recae en la personalización, y la AGI será más personalizada que la generación anterior de motores de recomendación.
Pero la personalización no se logra mediante fine-tuning; se logra al admitir un contexto muy largo. Todo su historial con la máquina es contexto, y ese contexto define el proceso de personalización. No se puede replicar, y permite un diálogo más directo: un diálogo que genera información.
Zhang Xiaojun: ¿Cuánto margen hay para escalar esto?
Yang Zhilin: Enorme. Por un lado, expandir la ventana en sí misma aún tiene un largo camino por recorrer: varios órdenes de magnitud.
Por otro lado, no se puede solo expandir la ventana, y no se puede mirar solo el número; si la ventana es de unos pocos millones de tokens o varios miles de millones hoy en día no tiene sentido en sí mismo. Hay que observar la capacidad de razonamiento que permite dentro de esa ventana, la fidelidad (fidelidad a la información original) y la capacidad de seguir instrucciones. No se debe perseguir una sola métrica; hay que combinar las métricas con las capacidades.
Si estas dos dimensiones siguen mejorando, se puede hacer mucho. Podría seguir una instrucción de decenas de miles de palabras, y la instrucción misma podría definir muchos agentes, altamente personalizados.
Zhang Xiaojun: ¿Las tecnologías detrás del contexto largo y la actualización con GPT-4 son reutilizables entre sí? ¿Son lo mismo?
Yang Zhilin: No lo creo. Se trata más de añadir una nueva dimensión, una dimensión que GPT-4 no tiene.
Zhang Xiaojun: Mucha gente dice que las principales empresas chinas de modelos fundacionales están haciendo más o menos lo mismo: persiguiendo GPT-3.5 en 2023, persiguiendo GPT-4 en 2024. ¿Está de acuerdo?
Yang Zhilin: Mejorar las capacidades generales ciertamente tiene hitos clave, por lo que esa afirmación es correcta hasta cierto punto: como rezagado, inevitablemente se pasa por un proceso de puesta al día. Pero también es unilateral. Más allá de las capacidades generales, hay mucho espacio para desarrollar capacidades distintivas y alcanzar el estado del arte en ciertas direcciones. El contexto largo es una. La generación de imágenes de DALL-E 3 es superada ampliamente por Midjourney V6. Así que hay que trabajar en ambos frentes.
Zhang Xiaojun: ¿Qué proporción de tiempo y recursos se destina a las capacidades generales frente a las nuevas dimensiones?
Yang Zhilin: Deben combinarse. Una nueva dimensión no puede existir aparte de las capacidades generales, por lo que es difícil dar una proporción directa. Pero se requiere una inversión suficiente para hacer bien la nueva dimensión.
Zhang Xiaojun: ¿Todas estas nuevas dimensiones serán llevadas por Kimi?
Yang Zhilin: Kimi es ciertamente un producto muy importante para nosotros, y también tendremos otros intentos.
Zhang Xiaojun: ¿Qué opina del comentario de Li Guangmi, fundador de Shixiang, de que la diferenciación tecnológica de las empresas chinas de modelos fundacionales aún no es muy alta hoy en día?
Yang Zhilin: Creo que está bien; ya hemos producido bastante diferenciación hoy. Es cuestión de tiempo; este año deberían ver más dimensiones. El año pasado, todos estaban solo poniendo el andamio y poniendo las cosas en marcha primero.
Zhang Xiaojun: Si el primer paso del moonshot es el contexto largo, ¿cuál es el segundo?
Yang Zhilin: Habrá dos grandes hitos por delante. Primero, un modelo de mundo verdaderamente unificado, que unifique todas las diferentes modalidades, una arquitectura verdaderamente escalable y general.
Segundo, permitir que la IA siga evolucionando sin entrada de datos humanos.
Zhang Xiaojun: ¿Cuánto tiempo tomará alcanzar estos dos hitos?
Yang Zhilin: Dos o tres años, posiblemente más rápido.
Zhang Xiaojun: Entonces, dentro de tres años, ya estaremos mirando un mundo completamente diferente al de hoy.
Yang Zhilin: Al ritmo actual de desarrollo, sí. La tecnología ahora está en una etapa incipiente y de rápido crecimiento.
Zhang Xiaojun: ¿Puede imaginar lo que existirá dentro de tres años?
Yang Zhilin: Habrá un cierto grado de AGI. Muchas de las cosas que hacemos hoy, la IA también podrá hacerlas, incluso mejor que nosotros. Pero la clave es cómo la usamos.
Zhang Xiaojun: Y para usted, para Moonshot AI como empresa, ¿cuál es el segundo paso?
Yang Zhilin: Iremos a hacer esas dos cosas. Todos los problemas restantes se derivan de estos dos factores. El razonamiento y los agentes de los que la gente habla hoy son subproductos de resolver estos dos problemas. Se necesita un tallado adicional, pero no hay un obstáculo fundamental.
Zhang Xiaojun: ¿Se va a enfocar completamente en ponerse al día con GPT-4?
Yang Zhilin: GPT-4 es una parada necesaria en el camino hacia la AGI. La clave es no conformarse con simplemente igualar a GPT-4. Primero, hay que preguntarse cuál es el verdadero no consenso ahora: más allá de GPT-4, ¿qué sigue? ¿Cómo deberían ser GPT-5 y GPT-6? Segundo, hay que ver qué capacidades distintivas se tienen dentro de eso, y eso es lo que más importa.
Zhang Xiaojun: Otras empresas de modelos fundacionales publican sus





