Ecco la traduzione in italiano:
Questa è stata la mia prima intervista con Yang Zhilin, condotta all'inizio del 2024 e pubblicata il 1° marzo 2024, esattamente nel primo anniversario della fondazione di Kimi. All'epoca, Kimi aveva solo 80 persone e lavorava nel loro primo ufficio, un po' fatiscente. Non c'era alcun logo all'ingresso. Solo un pianoforte bianco faceva la guardia vicino alla porta.
Questo articolo ha suscitato un notevole scalpore nella comunità tech cinese all'epoca.
Allora ero ancora un giornalista della carta stampata, quindi questa intervista esiste solo come testo e come podcast audio.
Come possiamo vedere, molte delle opinioni espresse in questo articolo sono state successivamente confermate.
Rileggendo queste parole di due anni fa, non si può fare a meno di meravigliarsi di come il mondo sia cambiato radicalmente!
(Questa traduzione è stata generata da Kimi K3.)
Yang Zhilin: "Se tutti pensano che tu sia normale – se il tuo sogno è uno che chiunque potrebbe avere – non aggiunge nulla alla somma totale dei sogni dell'umanità."
Di Zhang Xiaojun
Solo un anno fa, lo scienziato dell'IA Yang Zhilin ha fatto un calcolo preciso nella Silicon Valley. Si è reso conto che se avesse deciso di lanciare una startup di modelli fondativi mirata all'AGI, avrebbe dovuto raccogliere più di 100 milioni di dollari nei mesi successivi.
Eppure quello era solo un biglietto per il gioco. Un anno dopo, quella cifra si era moltiplicata per tredici.
Per le aziende di modelli fondativi, la competizione è meno una sfida scientifica e, prima di tutto, una brutale sfida di denaro. Con gli investitori che tengono stretti i cordoni della borsa, devi stare davanti ai tuoi rivali nel raccogliere più soldi, acquistare più GPU e accaparrarti più talenti.
"Richiede una concentrazione di talenti e una concentrazione di capitali", afferma Yang Zhilin, fondatore e CEO di Moonshot AI, l'azienda di modelli fondativi fondata il 1° marzo 2023.
Nell'ultimo anno, le aziende cinesi di modelli fondativi sono sembrate vivere su un orlo teso e contratto di sopravvivenza. In superficie, ognuna di esse detiene ingenti somme di denaro. Ma da un lato, devono immediatamente riversare i soldi appena raccolti in una ricerca estremamente costosa per inseguire OpenAI – prima raggiungere GPT-3.5, e prima ancora di raggiungere GPT-4, arriva Sora. Dall'altro lato, devono correre senza sosta per trovare casi d'uso reali e praticabili, per dimostrare a se stesse di essere aziende, non istituti di ricerca che divorano solo capitale. E non basta: per ognuna di queste iniziative, che l'uscita sia una IPO o un'acquisizione, la via d'uscita rimane tutt'altro che chiara.
Tra i fondatori delle aziende cinesi di modelli fondativi, Yang Zhilin è il più giovane, nato nel 1992. Il settore lo descrive come un convinto credente nell'AGI e un fondatore con un raro carisma tecnico. Gran parte del suo curriculum accademico e professionale è legato all'IA per scopi generali, e i suoi articoli sono stati citati oltre 22.000 volte.
A metà del 2023, la comunità tech cinese è passata bruscamente dall'euforia al gelo riguardo ai modelli fondativi, e accelerare l'implementazione nel mondo reale è diventata la melodia mainstream pragmatica. Ciò ha inevitabilmente lasciato i CEO dei modelli fondativi lacerati violentemente tra ideale e realtà. In un ecosistema di IA cinese dove tutti inneggiano al PMF (product/market fit) e tutti inneggiano alla commercializzazione, questo fondatore – un ricercatore di IA di formazione – non ha una particolare fretta.
Con 80 persone, Moonshot AI ha il numero più basso di dipendenti tra le principali aziende cinesi di modelli fondativi. A differenza dei suoi rivali, Yang non ha scelto la più sicura attività B2B o la distribuzione in settori verticali come la sanità o i giochi. Ha costruito uno – e uno solo – prodotto di consumo: l'assistente AI Kimi, che accetta input fino a 200.000 caratteri cinesi. Kimi è anche il nome inglese di Yang Zhilin.
Yang preferisce vedere la sua azienda come un sistema che combina scienza, ingegneria e business. Potresti immaginarlo così: al di sopra del mondo umano, sta erigendo un banco da laboratorio di IA – con una mano conduce esperimenti, e con l'altra porta la tecnologia all'avanguardia nel mondo reale, scoprendo applicazioni attraverso l'interazione con le persone e consegnando quelle applicazioni nelle mani dei consumatori. Idealmente, il primo brucia miliardi e decine di miliardi di dollari di capitale; il secondo guadagna quei soldi centinaia o migliaia di volte. Comunque la si senta, sembra emozionante – e altrettanto pericolosa – come camminare su una corda tesa.
"L'IA non riguarda quale PMF posso trovare nel prossimo anno o due, ma come cambiare il mondo nei prossimi dieci o vent'anni", dice.
Un pensiero così astratto e idealistico fa sudare nervosamente per lui: può un giovane scienziato dell'IA ritagliarsi uno spazio per sopravvivere in una Cina realista?
Nel febbraio 2024, Moonshot AI ha chiuso un grande round di finanziamento contro la tendenza del mercato. È risaputo che la società ha raccolto un Serie B di oltre 1 miliardo di dollari con una valutazione pre-money di 1,5 miliardi di dollari, guidato da Alibaba con la partecipazione successiva di Monolith Management, Xiaohongshu e altri. Al completamento dell'operazione, la valutazione post-money di Moonshot AI era di circa 2,5 miliardi di dollari – rendendola, in questa fase, l'unicorno con la valutazione più alta nella corsa cinese ai modelli fondativi. (La società ha rifiutato di rispondere o commentare la questione.)
Nel bel mezzo di questo terzo round di finanziamento, ci siamo seduti con Yang Zhilin per parlare del suo primo anno di imprenditoria – una sezione trasversale, in miniatura, di un anno in cui le aziende cinesi di modelli fondativi sono corse in avanti dalla linea di partenza.
La sua azienda non si è stabilita presso la Sohu Network Plaza di Pechino, il centro dove si concentrano le aziende di modelli fondativi. Per un'azienda con un finanziamento totale di circa 9 miliardi di RMB, questo ufficio nell'edificio Liangzi Xinzuo sembra grezzo e fatiscente. Non c'è nemmeno un logo aziendale all'ingresso – solo un pianoforte bianco che fa la guardia vicino alla porta.
La sala riunioni è in un angolo; con le sue piccole finestre è buia all'interno, e il riscaldamento ronza mentre soffia aria calda contro il freddo invernale. Nella luce fioca, Yang descrive come gli è sembrato l'ultimo anno: "È un po' come guidare lungo una strada con una catena di montagne innevate che si estendono davanti. Non sai cosa c'è dentro. Continui solo ad andare avanti, un passo alla volta."
Di seguito è riportata l'intervista completa a Yang Zhilin. (Per leggibilità, l'autore ha apportato alcune modifiche testuali.)

Questa foto è stata scattata all'inizio del 2024 nel primo ufficio di Kimi a Pechino. Ora si sono trasferiti da questa sede. Nessun logo allineava l'ingresso – solo un pianoforte bianco stava silenziosamente vicino alla porta.
**
Parte 1
All'inizio
"Devi Cavalcare l'Onda"
**
Zhang Xiaojun: Come stai ultimamente?
Yang Zhilin: Impegnato – c'è molto da fare. Ma sono ancora entusiasta. Siamo all'inizio di un settore e c'è un enorme spazio per l'immaginazione.
Zhang Xiaojun: Quando sono entrato poco fa, ho visto un pianoforte bianco puro all'ingresso della tua azienda.
Yang Zhilin: C'è anche un album dei Pink Floyd sopra. Non ho idea di chi li abbia messi lì – li ho notati improvvisamente un paio di giorni fa e non ho ancora avuto modo di chiedere. (I Pink Floyd sono la band rock britannica che ha pubblicato l'album The Dark Side of the Moon.)
Zhang Xiaojun: Il giorno in cui è stato rilasciato ChatGPT, nel novembre 2022, cosa stavi facendo?
Yang Zhilin: Mi stavo già preparando per questo – reclutando persone, costruendo un team, scambiando nuove idee. Vedere ChatGPT è stato emozionante. Da tre a cinque anni prima – anche nel 2021 – sarebbe stato inconcepibile. Quel tipo di ragionamento di ordine superiore era stato molto difficile da ottenere.
Ho percepito che molte variabili stavano per cambiare nel mercato: il capitale da un lato, il talento dall'altro – i fattori di produzione principali per l'IA. Se quelle variabili fossero andate al loro posto, sarebbe stato possibile costruire un'azienda vera e propria per fare questo – un'organizzazione costruita per l'AGI potrebbe andare da 0 a 1. Quella è stata una grande epifania. Un'azienda indipendente aveva più senso, ma non era qualcosa che si poteva fare nel momento in cui lo si desiderava; ChatGPT ha scosso le variabili e ha riunito i fattori di produzione. Devi cavalcare l'onda.
Zhang Xiaojun: Dopo aver deciso di fondare un'azienda AGI, quali preparativi hai fatto? Come hai assemblato i due fattori di produzione – capitale e talento?
Yang Zhilin: È stato un processo tortuoso. ChatGPT ha impiegato tempo a diffondersi. Alcuni ne hanno saputo presto, altri tardi; alcuni hanno dubitato all'inizio, poi sono rimasti scioccati, poi sono diventati credenti. Trovare persone e trovare soldi erano strettamente legati ai tempi.
Abbiamo iniziato a concentrarci sul nostro primo round di finanziamento nel febbraio 2023. Se avessimo aspettato fino ad aprile, non avremmo praticamente avuto alcuna possibilità. Ma farlo a dicembre 2022 o gennaio 2023 non avrebbe funzionato: la pandemia era ancora in corso e le persone non l'avevano ancora elaborata. Quindi la vera finestra era solo un mese.
Una notte negli Stati Uniti, ho fatto un calcolo preciso. Quando ho finito, ho concluso che dovevamo raccogliere almeno 100 milioni di dollari in pochi mesi. Molti nel mercato non avevano ancora iniziato a raccogliere fondi, e molti non credevano che si potesse necessariamente raccogliere così tanto. Ma si è rivelato possibile – anche di più.
Anche il mercato dei talenti ha iniziato a muoversi. Ispirate da ChatGPT, molte persone hanno avuto questa realizzazione nel marzo o aprile 2023: questa è l'unica cosa che vale la pena fare nel prossimo decennio. Devi contattare le persone giuste al momento giusto. Un anno o due prima, il talento non si sarebbe raggruppato a questo livello. Allora, più persone facevano IA tradizionale o attività affini all'IA – niente di tutto ciò era IA per scopi generali.
Zhang Xiaojun: Per riassumere: febbraio è stata la finestra per la raccolta fondi, e marzo e aprile sono state le finestre per le assunzioni?
Yang Zhilin: Più o meno.
Zhang Xiaojun: Quella notte negli Stati Uniti – dove eri quando hai fatto questo calcolo? Come hai calcolato esattamente?
Yang Zhilin: Da fine 2022 all'inizio del 2023, ho passato un mese o due negli Stati Uniti, parlando con le persone. L'ho fatto dove vivevo. Calcoli quanti FLOP servono, il costo di addestramento, l'inferenza e il numero di utenti.
Zhang Xiaojun: In quel momento, qual era l'umore prevalente nella Silicon Valley?
Yang Zhilin: Il prodotto ha iniziato ad attrarre molti early adopter, concentrati nella cerchia tech. Eravamo in quella cerchia noi stessi, quindi lo abbiamo sentito più intensamente. Nelle grandi aziende della Silicon Valley, le persone devono scrivere valutazioni delle prestazioni ogni sei mesi, e molti hanno iniziato a scriverle con ChatGPT. Alcune persone la cui scrittura di solito non era molto professionale hanno consegnato valutazioni scritte con ChatGPT, e tutti sembravano estremamente seri.
Sotto la superficie fermentava. Molte persone pensavano al loro prossimo lavoro o a fondare un'azienda. Molti amici con cui abbiamo parlato in seguito hanno fondato startup. E c'era un'intensa FOMO – paura di perdersi qualcosa. Nessuno riusciva a dormire. Che fosse mezzanotte, l'una di notte o le due, se li contattavi, le persone c'erano sempre. Un po' ansiosi, un po' in FOMO, e molto eccitati.
Zhang Xiaojun: La notte in cui hai calcolato di aver bisogno di raccogliere 100 milioni di dollari – fino a che ora sei rimasto sveglio?
Yang Zhilin: È andata bene – il calcolo in sé non ha richiesto molto tempo. Ma dopo, non potevo dirlo a troppe persone. Se l'avessi fatto, nessuno avrebbe creduto che si potesse fare.
Parte 2
Lignaggio Tecnico
"Liberati dall'Intaglio Infinito"
Zhang Xiaojun: Quando il mondo del venture capital parla di te, dicono: "Il fondatore è brillante, ha carisma tecnico, e il team è pieno di stelle tecniche." Quindi, prima di discutere la tua impresa di modelli fondativi, vorrei iniziare con il tuo background accademico. Hai studiato informatica alla Tsinghua come laurea triennale e hai conseguito il dottorato alla School of Computer Science della Carnegie Mellon. L'IA è sempre stata il tuo focus?
Yang Zhilin: Sono nato nel 1992 e ho iniziato la mia laurea triennale nel 2011. Dal mio secondo anno fino ad ora – più di un decennio – sono stato in questo campo. All'inizio ho esplorato in modo più divergente, guardandomi intorno; ho fatto qualche lavoro relativo ai grafi e alla multimodalità. Nel 2017, mi sono concentrato sui modelli linguistici. All'epoca sentivo che i modelli linguistici erano un problema relativamente importante; più tardi ho sentito che era l'unico problema importante.
Zhang Xiaojun: Nel 2017, come comprendeva generalmente l'industria dell'IA i modelli linguistici, e come si è evoluta quella comprensione?
Yang Zhilin: Allora era un modello usato per classificare i risultati del riconoscimento vocale. (Ride.) Dopo che un segmento di parlato veniva riconosciuto, si ottenevano molti risultati candidati, e si usava il modello linguistico per vedere quale avesse la probabilità più alta e produrre quello più probabile. Le sue applicazioni erano molto limitate.
Ma ti rendi conto che è un problema fondamentale, perché stai modellando le probabilità del mondo. Il linguaggio è limitato, ma è una proiezione del mondo; in teoria, se rendi lo spazio dei token – lo spazio di tutti i possibili token – abbastanza grande, puoi costruire un modello del mondo generale. Come tutto nel mondo nasce e si sviluppa può essere assegnato a una probabilità. Ogni problema può essere ridotto a come stimare le probabilità.
Zhang Xiaojun: I tuoi mentori accademici sono molto importanti: i tuoi supervisor di dottorato erano Ruslan Salakhutdinov, capo dell'IA presso Apple, e William W. Cohen, capo scienziato di Google AI. Entrambi si trovano a cavallo tra industria e accademia.
Yang Zhilin: Negli anni precedenti, industria e accademia erano più unite, ma la tendenza ora sta cambiando: le scoperte più preziose avverranno nell'industria. Questa è una legge inevitabile dello sviluppo. Inizia con la ricerca esplorativa e gradualmente si sposta verso un processo di industrializzazione più maturo. Questo non significa che la ricerca non sia necessaria durante l'industrializzazione – solo che la ricerca pura farà fatica a produrre scoperte preziose.
Zhang Xiaojun: Cosa hai imparato da questi rinomati mentori?
Yang Zhilin: Ho imparato di più a Google, dove ho fatto uno stage lungo. Ho iniziato a lavorare su modelli linguistici basati su Transformer alla fine del 2018. La mia più grande lezione è stata liberarmi dall'infinito 'intaglio' – l'ossessivo perfezionamento dei dettagli superficiali. Questo è stato cruciale.
Dovresti guardare qual è la direzione generale, il gradiente grande. Quando hai dieci strade davanti a te, la persona media si preoccupa di come frenare per un pedone più avanti su questa strada – dettagli a breve termine. Ma quale delle dieci strade prendere è ciò che conta di più.
Questo campo in precedenza aveva esattamente quel problema. Ad esempio, su un dataset di solo uno o due milioni di token, guardavi come abbassare la perplessità, come abbassare la loss, come migliorare l'accuratezza – e cadevi nell'intaglio infinito. Le persone hanno inventato molte architetture bizzarre; questi erano trucchi di intaglio. Dopo l'intaglio, potresti fare meglio su quel tipo di dataset, ma perdi l'essenza del problema.
L'essenza è analizzare cosa manca al campo. Qual è il primo principio? Perché la scaling law può servire come primo principio? Devi solo trovare una struttura che soddisfi due condizioni: primo, è sufficientemente generale; secondo, è scalabile. Generale significa che puoi modellare tutti i problemi all'interno di questa struttura; scalabile significa che finché versi abbastanza potenza di calcolo, continua a migliorare.
Questo è il pensiero che ho imparato a Google: se qualcosa può essere spiegato da qualcosa di più fondamentale, non dovresti intagliare troppo agli strati superiori. C'è una linea importante con cui sono fortemente d'accordo: se puoi risolvere un problema con la scala, non risolverlo con un nuovo algoritmo. Il più grande valore di un nuovo algoritmo è come ti permette di scalare meglio. Quando ti liberi dall'intaglio, puoi vedere molto di più.
Zhang Xiaojun: Anche Google era un seguace della scaling law allora? Come implementava il pensiero basato sui primi principi?
Yang Zhilin: Molte di queste idee esistevano già lì, ma Google non le ha implementate particolarmente bene. Aveva questo modo di pensare, ma non poteva organizzarsi in un vero moonshot. Era più come: qui ci sono cinque persone che perseguono i miei primi principi, e laggiù cinque che perseguono i loro. Non c'era nulla di top-down.
Zhang Xiaojun: Durante il tuo dottorato, hai pubblicato articoli in collaborazione con i vincitori del Premio Turing Yann LeCun e Yoshua Bengio – ed eri il primo autore di quegli articoli. Come sono avvenute queste collaborazioni? Quello che voglio dire è: sono vincitori del Premio Turing e non erano i tuoi supervisor – su cosa hai fatto affidamento per attrarli?
Yang Zhilin: Il mondo accademico è molto aperto. Finché hai una buona idea e un problema significativo, va bene. Ciò che due cervelli – o n cervelli – producono è più di un solo cervello. Questo vale anche quando si sviluppa l'AGI. Una strategia importante nell'IA si chiama 'ensembling' – usare più modelli o metodi diversi e combinare le loro previsioni per ottenere prestazioni migliori. Essenzialmente si fa la stessa cosa: quando hai punti di vista diversi, puoi stimolare molte cose nuove. La collaborazione è enormemente vantaggiosa.
Zhang Xiaojun: Prima avevi un'idea e poi chiedevi loro se erano interessati?
Yang Zhilin: Più o meno così.
Zhang Xiaojun: Cosa è più difficile: convincere i pesi massimi accademici nella ricerca, o convincere i pesi massimi del capitale nella raccolta fondi? Quali sono le somiglianze?
Yang Zhilin: "Convincere" non è una buona parola – l'essenza dietro di essa è la cooperazione. Cooperazione significa che entrambe le parti vincono, perché il beneficio reciproco è il prerequisito per la cooperazione. Quindi non c'è davvero differenza: devi offrire agli altri un valore unico.
Zhang Xiaojun: Come guadagni la loro fiducia? Quale pensi sia il tuo dono?
Yang Zhilin: Non c'è un dono particolare – solo lavorare sodo.
Parte 3
Il Vecchio Sistema Non Funziona Più
"L'AGI Ha Bisogno di un Nuovo Tipo di Organizzazione"
**
Zhang Xiaojun: Hai appena detto "le scoperte più preziose avverranno nell'industria" – questo include le startup e i laboratori di IA dei giganti?
Yang Zhilin: I laboratori sono storia. Google Brain era il più grande laboratorio di IA nell'industria, ma era un'organizzazione di ricerca inserita all'interno di una grande azienda. Quel tipo di organizzazione può esplorare nuove idee, ma è molto difficile che produca un grande sistema – potrebbe produrre il Transformer, ma non potrebbe produrre ChatGPT.
Il modo in cui lo sviluppo ora evolve è che stai costruendo un sistema enorme, che richiede nuovi algoritmi, una solida ingegneria, e persino molto lavoro di prodotto e commercializzazione. È come i primi anni 2000: non potevi fare ricerca sul recupero delle informazioni in un laboratorio; doveva vivere nel mondo reale, come un grande sistema, un prodotto con utenti – come Google. Quindi i sistemi di ricerca e istruzione sposteranno la loro funzione principalmente verso la coltivazione di talenti.
Zhang Xiaojun: Come descriveresti questa nuova forma di sistema? OpenAI è il suo prototipo?
Yang Zhilin: È l'organizzazione più matura di questo tipo oggi, e sta ancora gradualmente evolvendo.
Zhang Xiaojun: Quindi può essere intesa come un'organizzazione istituita per i grandi obiettivi scientifici dell'umanità?
Yang Zhilin: Voglio sottolineare: non è pura scienza – è una combinazione di scienza, ingegneria e business. Deve essere un'organizzazione commerciale, un'azienda, non un istituto di ricerca. Ma questa azienda è costruita da zero a uno, perché l'AGI ha bisogno di un nuovo tipo di organizzazione. Primo, il modo di produzione differisce dall'era di Internet; secondo, si sposta dalla pura ricerca a una combinazione di ricerca, ingegneria, prodotto e business.
Al suo nucleo, dovrebbe essere un programma moonshot, con una grande quantità di pianificazione top-down – eppure all'interno di quella pianificazione c'è spazio per l'innovazione, perché non tutta la tecnologia è predeterminata. Esistono elementi bottom-up all'interno di una struttura top-down. Un'organizzazione del genere non esisteva prima, ma l'organizzazione deve adattarsi alla tecnologia, perché la tecnologia determina il modo di produzione; se non corrispondono, non puoi produrre efficacemente. Crediamo che molto probabilmente dovrà essere riprogettata da zero.
Zhang Xiaojun: Durante il colpo di stato del consiglio di amministrazione di OpenAI l'anno scorso, un'opzione per Sam Altman era di unirsi a Microsoft e guidare un nuovo team AI di Microsoft. Qual è la differenza essenziale tra questo e essere il CEO di OpenAI?
Yang Zhilin: Dovresti far crescere una nuova organizzazione all'interno di una vecchia cultura – e questo è estremamente difficile.
Zhang Xiaojun: Vuoi costruire "l'OpenAI della Cina" – possiamo dirlo così?
Yang Zhilin: Non del tutto accurato. Non vogliamo essere la "Cina di qualcosa", e non vogliamo necessariamente essere OpenAI.
Primo, la vera AGI sarà sicuramente globale. Non esiste – almeno non a lungo termine – un'azienda AGI confinata a qualche mercato regionale a causa di meccanismi di protezione del mercato. La globalizzazione, l'AGI e avere un prodotto con una base di utenti molto ampia: queste tre sono in definitiva condizioni necessarie.
Secondo, dovrebbe essere OpenAI? Se guardi al 2017-2018, OpenAI aveva una pessima reputazione. Quando le persone nella nostra cerchia cercavano lavoro, consideravano generalmente posti come Google. Molte persone che hanno parlato con Ilya Sutskever, il capo scienziato di OpenAI, ne sono uscite pensando che l'uomo fosse pazzo e troppo pieno di sé – OpenAI era o pazzi o truffatori. Ma si sono impegnati molto presto, hanno trovato il non-consenso, e hanno trovato quello che ora è l'unico primo principio che funziona nell'IA: lo scaling attraverso la previsione del token successivo.
Credo che ci sarà un'azienda più grande di OpenAI. Un'azienda veramente grande può combinare l'idealismo tecnologico con un grande prodotto, co-creando con i suoi utenti – l'AGI sarà in definitiva qualcosa prodotto dal lavoro congiunto con tutti i suoi utenti. Quindi non si tratta solo di tecnologia; richiede anche pragmatismo e perseguimenti nel mondo reale – in definitiva, una combinazione perfetta dei due.
Tuttavia, dovremmo imparare dall'idealismo tecnologico di OpenAI. Se tutti pensano che tu sia normale – se il tuo sogno è uno che chiunque potrebbe avere – non aggiunge nulla alla somma totale dei sogni dell'umanità.
Parte 4
Il Primo Passo di Moonshot è il "Contesto Lungo" – Qual è il Secondo?
"Due Grandi Pietre Miliari Arrivano Prossimamente"
**
Zhang Xiaojun: Tornando al momento in cui hai deciso di avviare l'azienda – hai lanciato il primo round di finanziamento subito dopo essere tornato in Cina?
Yang Zhilin: È iniziato negli Stati Uniti a febbraio (dell'anno scorso), in parte a distanza. Alla fine, gli investitori nazionali hanno costituito la maggioranza.
Zhang Xiaojun: Il primo round ha raccolto 100 milioni di dollari?
Yang Zhilin: Il primo round non era così tanto; i round successivi hanno superato quella cifra. Abbiamo completato due round nel 2023, per un totale di quasi 2 miliardi di RMB.
Questo è ora il terzo round. Non abbiamo annunciato formalmente il finanziamento, quindi non posso commentare in questo momento.
Zhang Xiaojun: Alcuni dicono che dalla seconda metà del 2023, nessuno è più disposto a investire in aziende di modelli fondativi. Si sbagliano?
Yang Zhilin: Ci sono ancora. Puoi effettivamente vedere il cambiamento di sentiment, ma non è che nessuno stia investendo – almeno per ora, c'è un notevole interesse di investimento nel mercato.
Zhang Xiaojun: Oltre al capitale e alle persone, quali altre decisioni chiave hai preso nel 2023?
Yang Zhilin: Decidere cosa fare. Questo è il vantaggio di aziende come la nostra – avere una visione tecnica per le decisioni al più alto livello.
Facciamo contesto lungo. Questo richiede un giudizio sul futuro: devi sapere cosa è fondamentale e dove stanno andando le cose dopo. Di nuovo, sono i primi principi – il processo di 'de-intaglio'. Se ti concentri sull'intaglio, puoi solo guardare a ciò che OpenAI ha già fatto e capire come riprodurlo.
Scoprirai che fare compressione lossless di testi lunghi in Kimi offre un'esperienza di prodotto unica. Quando leggi articoli in inglese, ti aiuta a capirli notevolmente bene. Usando Claude o GPT-4 oggi, non è detto che tu faccia altrettanto bene; questo ha richiesto di gettare le basi in anticipo. Ci abbiamo lavorato per oltre sei mesi. Questo è molto diverso dall'individuare una tendenza di contesto lungo oggi, assemblare frettolosamente due team e svilupparlo alla massima velocità.
Certo, la maratona è appena iniziata; arriveranno ulteriori differenziazioni, e questo richiede di anticipare ciò che conta come "un non-consenso che si rivela vero".
Zhang Xiaojun: In che mese è stata presa questa decisione?
Yang Zhilin: Febbraio o marzo: è stata decisa appena fondata l'azienda.
Zhang Xiaojun: Perché il contesto lungo è il primo passo del "moonshot"?
Yang Zhilin: Perché è fondamentale. È la memoria del nuovo computer.
La memoria del vecchio computer è cresciuta di diversi ordini di grandezza negli ultimi decenni, e la stessa cosa accadrà con il nuovo computer. Può risolvere molti dei problemi di oggi. Per esempio, le attuali architetture multimodali hanno ancora bisogno di un tokenizer, ma con un contesto lungo compresso senza perdita di informazioni non ne hai bisogno: puoi inserire direttamente l'input grezzo. Portato oltre, è la base per rendere il nuovo paradigma computazionale più generale.
Il vecchio computer poteva rappresentare tutto con 0 e 1; tutto poteva essere digitalizzato. Ma il nuovo computer di oggi non può ancora farlo: non c'è abbastanza contesto, quindi non è così generale. Per diventare un modello del mondo generale, hai bisogno di un contesto lungo.
In secondo luogo, abilita la personalizzazione. Il valore centrale dell'AI è l'interazione personalizzata; il valore approda infine alla personalizzazione, e l'AGI sarà più personalizzata della precedente generazione di motori di raccomandazione.
Ma la personalizzazione non si ottiene tramite il fine-tuning: si ottiene supportando un contesto molto lungo. La tua intera storia con la macchina è contesto, e quel contesto definisce il processo di personalizzazione. Non può essere replicato e permette un dialogo più diretto, un dialogo che genera informazioni.
Zhang Xiaojun: Quanto margine c'è per scalare questo aspetto?
Yang Zhilin: Enorme. Da un lato, espandere la finestra stessa ha ancora molta strada da fare, diversi ordini di grandezza.
Dall'altro lato, non puoi solo espandere la finestra e non puoi guardare solo al numero; se la finestra è di pochi milioni di token o diversi miliardi oggi è di per sé insignificante. Devi guardare alla capacità di ragionamento che abilita all'interno di quella finestra, la fedeltà all'informazione originale e la capacità di seguire le istruzioni. Non dovresti inseguire un singolo parametro; devi combinare i parametri con le capacità.
Se queste due dimensioni continuano a migliorare, si può fare moltissimo. Potrebbe seguire un'istruzione lunga decine di migliaia di parole, e l'istruzione stessa potrebbe definire molti agenti altamente personalizzati.
Zhang Xiaojun: Le tecnologie alla base del contesto lungo e del recupero del ritardo su GPT-4 sono riutilizzabili l'una per l'altra? Sono la stessa cosa?
Yang Zhilin: Non credo. Si tratta più di aggiungere una nuova dimensione, una dimensione che GPT-4 non ha.
Zhang Xiaojun: Molti dicono che le principali aziende cinesi di modelli fondamentali stanno facendo più o meno la stessa cosa: inseguire GPT-3.5 nel 2023, inseguire GPT-4 nel 2024. Sei d'accordo?
Yang Zhilin: Migliorare le capacità generali ha certamente tappe fondamentali, quindi quell'affermazione è giusta in una certa misura: come ritardatario, si passa inevitabilmente attraverso un processo di recupero. Ma è anche unilateralmente. Oltre alle capacità generali, c'è molto spazio per sviluppare capacità distintive e raggiungere lo stato dell'arte in determinate direzioni. Il contesto lungo è una di queste. La generazione di immagini di DALL-E 3 è nettamente superata da Midjourney V6. Quindi bisogna lavorare su entrambi i fronti.
Zhang Xiaojun: Che proporzione di tempo e risorse va alle capacità generali rispetto alle nuove dimensioni?
Yang Zhilin: Devono essere combinate. Una nuova dimensione non può esistere separatamente dalle capacità generali, quindi è difficile dare un rapporto diretto. Ma è necessario un investimento sufficiente per fare bene la nuova dimensione.
Zhang Xiaojun: Tutte queste nuove dimensioni saranno veicolate da Kimi?
Yang Zhilin: Kimi è certamente un prodotto molto importante per noi, e avremo anche alcuni altri tentativi.
Zhang Xiaojun: Cosa pensi del commento di Li Guangmi, fondatore di Shixiang, secondo cui la distintività tecnologica delle aziende cinesi di modelli fondamentali è ancora oggi molto bassa?
Yang Zhilin: Penso che vada bene: abbiamo già prodotto parecchia differenziazione oggi. È una questione di tempo; quest'anno dovresti vedere più dimensioni. L'anno scorso, tutti stavano solo mettendo su l'impalcatura e facendo funzionare le cose per prime.
Zhang Xiaojun: Se il primo passo del "moonshot" è il contesto lungo, qual è il secondo?
Yang Zhilin: Ci saranno due grandi traguardi davanti. Primo, un modello del mondo veramente unificato, che unifichi tutte le diverse modalità, un'architettura veramente scalabile e generale.
Secondo, permettere all'AI di continuare ad evolversi senza input di dati umani.
Zhang Xiaojun: Quanto tempo ci vorrà per raggiungere questi due traguardi?
Yang Zhilin: Da due a tre anni, probabilmente più velocemente.
Zhang Xiaojun: Quindi tra tre anni, guarderemo già un mondo completamente diverso da quello di oggi.
Yang Zhilin: Al ritmo attuale di sviluppo, sì. La tecnologia è ora in una fase nascente e in rapida crescita.
Zhang Xiaojun: Riesci a immaginare cosa esisterà tra tre anni?
Yang Zhilin: Ci sarà un certo grado di AGI. Molte delle cose che facciamo oggi, l'AI sarà in grado di farle, anche meglio di noi. Ma la chiave è come la usiamo.
Zhang Xiaojun: E per te, per Moonshot AI come azienda, qual è il secondo passo?
Yang Zhilin: Andremo a fare quelle due cose. Tutti i problemi rimanenti derivano da questi due fattori. Il ragionamento e gli agenti di cui si parla oggi sono sottoprodotti della risoluzione di questi due problemi. È necessaria qualche ulteriore rifinitura, ma non c'è un blocco fondamentale.
Zhang Xiaojun: Punterai tutto sul recuperare il ritardo su GPT-4?
Yang Zhilin: GPT-4 è una tappa necessaria sulla strada verso l'AGI. La chiave è non accontentarsi di eguagliare semplicemente GPT-4. Primo, devi chiederti qual è il vero non-consenso ora: oltre GPT-4, cosa c'è dopo? Come dovrebbero essere GPT-5 e GPT-6? Secondo, devi vedere quali capacità distintive hai all'interno di questo, e questo conta di più.
Zhang Xiaojun: Altre aziende di modelli fondamentali pubblicano i loro





