Desde ontem à noite, as contas públicas do WeChat têm republicado freneticamente a gravação de Liang Wenfeng, da DeepSeek, usando IA para resumir e escrever artigos.
Baixe o PDF da transcrição da gravação original
📎
https://xiangyangqiaomu.feishu.cn/wiki/Ojsuw8gE6ieBZJkYOMtcOcaenwq
A DeepSeek tem um modelo chamado DDCP. No dia em que seu preço foi reduzido a um quarto do original, o grupo da empresa no chat foi tomado por comemorações.
Em uma reunião financeira de uma empresa normal, uma redução de preço significa queda na receita e é uma má notícia que resulta em bronca.
A DeepSeek tratou isso como um momento digno de celebração.
Nesta reunião de três horas e quarenta e quatro minutos, Liang Wenfeng repetiu uma coisa: Eles não têm dinheiro, não têm cartas na manga, não têm fama, não têm talentos de primeira linha no time, e nem ele mesmo se formou na melhor escola.
Como um grupo de pessoas comuns criou, em dois anos, algo que deixou o mundo inteiro nervoso?
O julgamento contraintuitivo de Liang Wenfeng: Na questão da IA, quem quer pegar mais, perde primeiro.
Quanto Mais Você Pega, Mais Rápido Morre
Liang Wenfeng fez um cálculo. Suponha que a IA possa eventualmente consumir 10% do PIB global, e a OpenAI queira ficar com 5% disso; esse cálculo é teoricamente sólido.
Mas, assim que surgir um concorrente disposto a ficar com apenas 1%, ele pode esmagar o anterior com um preço mais baixo.
Então, outro aparecerá, querendo apenas 0,1%, esmagando o anterior também.
Essa corrente continuará rolando para baixo até atingir um ponto de equilíbrio: se você pegar pouco demais, o modelo de negócios não se sustenta e você é eliminado naturalmente; se pegar demais, será espremido camada por camada por aqueles que pegam menos.
Liang Wenfeng foi direto: Ele não tem dúvidas de que a AGI terá um enorme valor comercial, mas, mais do que pensar em como obter uma fatia maior, ele se preocupa em como aumentar a probabilidade de torná-la realidade.
E a maneira de aumentar essa probabilidade é justamente encolher ativamente a parte que ele quer pegar.
Aplicando essa lógica aos preços, a API da DeepSeek foi projetada para atingir o ponto de equilíbrio em dez meses, o que corresponde a aproximadamente seis vezes o lucro.
Isso não é maximização de lucro. Se eles realmente quisessem maximizar o lucro, o preço deveria ser mais alto, porque a demanda dos usuários na faixa atual é inelástica; um aumento de preço não reduziria significativamente o consumo.
Mas o lucro de seis vezes é ativamente fixado nesse limite superior por uma razão muito prática: Ao manter a margem de lucro baixa o suficiente, torna-se não lucrativo para terceiros roubarem negócios implantando modelos de código aberto por conta própria.
Código aberto e baixo lucro são dois lados da mesma moeda.
Em vez de depender do código fechado para garantir lucros, eles dependem da compressão dos lucros a um nível que outros não podem pagar para replicar, preservando assim o próprio mercado.
Liang Wenfeng calculou que, se eles realmente quisessem ganhar cem vezes o lucro, o código aberto se tornaria uma brecha, pois os custos de implantação de terceiros poderiam ser apenas um vigésimo dos deles.
Mas a DeepSeek nunca pretendeu seguir esse caminho desde o início.
Ele não está preocupado com o código aberto porque nunca pensou em ganhar cem vezes o lucro por meio de um monopólio vertical.
Essa lógica de "ganhar intencionalmente menos" explica quase todas as decisões aparentemente não lucrativas que essa empresa toma.
Gergelim na Frente, Melancias Atrás
No último Ano Novo Chinês, a base de usuários finais (lado C) da DeepSeek explodiu repentinamente.
Isso não estava nos planos. A equipe até considerou não manter esses usuários, mas os usuários "não iam embora" e acabaram ficando.
A explicação de Liang Wenfeng para esse fenômeno é direta: Tratar as coisas que você pode pegar na sua frente como a prioridade máxima fará você perder oportunidades maiores.
Ele chama isso de "pegar gergelim". O tráfego do lado C do ano passado e a receita do lado empresarial (lado B) deste ano são, na visão dele, apenas gergelim — pegar de passagem é suficiente; não vale a pena parar para isso.
A verdadeira melancia é a AGI, e a oportunidade da AGI é sempre grande o suficiente para que não haja necessidade de calcular precisamente quanta participação você pode ocupar agora.
Isso leva a um resultado interessante: A DeepSeek cria produtos quase por acidente.
Liang Wenfeng disse que o ponto de partida para o treinamento e a API da empresa nunca foi atender bem aos usuários, mas porque essa etapa precisa ser superada no caminho para a AGI. Usuários e receita são apenas subprodutos gerados ao longo do caminho.
Essa estratégia é, aos olhos dele, uma forma de ataque de redução de dimensionalidade: uma organização com a AGI como objetivo dedica muito menos pensamento a produtos do lado C e B do que empresas que tratam o produto em si como o objetivo, e ainda assim os resultados não são necessariamente piores.
A explicação dele é que uma visão maior pode unir melhor os melhores talentos; a vantagem de talento resultante transbordará naturalmente para o nível do produto, tornando-se um ataque de redução de dimensionalidade.
Por outro lado, uma empresa que trata "fazer um bom produto" como o objetivo final terá vantagens na experiência do produto, tráfego e atendimento ao usuário, mas, em termos de capacidades técnicas upstream, pode nunca alcançar uma empresa que trata a própria tecnologia como o objetivo final.
A mesma contenção também determina as coisas que a DeepSeek escolhe não fazer.
Sem Fabricação de Chips, Sem Cadeia Industrial Completa
Um investidor perguntou a Liang Wenfeng se ele migraria para upstream para fabricar chips ou para downstream em aplicações verticais como finanças ou saúde.
A resposta dele foi não.
A razão é uma metáfora de usina elétrica: a pessoa que opera a usina não precisa construir o gerador. Desde que possa comprá-lo a um preço razoável, por que construir?
Isso é uma extensão da mesma lógica de "contenção".
Liang Wenfeng disse que a torta da IA é grande o suficiente para que muitas empresas de trilhões de dólares surjam no futuro. A DeepSeek precisa ser apenas uma delas, comendo apenas a parte em que é melhor, sem precisar engolir toda a cadeia industrial.
Comer demais levará, em vez disso, a uma saída precoce.
A mesma atitude se aplica aos concorrentes.
Liang Wenfeng disse que a DeepSeek está disposta a ajudar a Alibaba, Zhipu e Moonshot AI a reproduzir modelos de código aberto melhores, porque isso não prejudica seus próprios interesses.
Parece educado, mas o algoritmo subjacente é consistente: Se o mercado é grande o suficiente, os outros se saírem bem não é uma ameaça; os outros se saírem mal e arruinarem a confiança de todo o ecossistema é a verdadeira perda.
A contenção explica o que a DeepSeek não faz.
Quanto ao que fará, a resposta é uma escada técnica que já foi pensada há muito tempo.
Uma Escada Que Pode Ser Subida Sem Hora Extra
Liang Wenfeng descreve a evolução da tecnologia de IA como subir uma escada camada por camada, onde cada passo é construído sobre o anterior e nenhum passo é desperdiçado.
O passo do ano passado foi a Cadeia de Pensamento (CoT), deixando o modelo aprender a pensar por si mesmo, empurrando o limite superior da inteligência um passo adiante, já superando os melhores humanos em codificação e problemas de Olimpíadas de Matemática.
O passo deste ano são os Agentes, empurrando os limites da capacidade ainda mais através da execução de tarefas de múltiplas etapas.
Mas o caminho dos Agentes também chegará ao fim.
Depois de chegar ao fim, o modelo ainda não pode substituir um funcionário real.
Liang Wenfeng deu um exemplo muito adequado: Quando um novo funcionário entra, ele passa dois meses se familiarizando com o ambiente. Depois disso, se você disser "chame o Xiao Wang aqui", ele entende.
A IA carece desses dois meses de acúmulo; você tem que explicar quem é o Xiao Wang, onde ele está e qual é o cargo dele antes que ela possa executar.
Essa limitação de "deve fornecer contexto completo" é a parede invisível entre a IA atual e a inteligência verdadeira.
O próximo passo a ser superado é a aprendizagem contínua: O modelo pode, como um novo funcionário, acumular experiência por conta própria através do contato contínuo com o ambiente, em vez de depender de humanos para alimentar contexto em sua boca toda vez?
Uma vez que a aprendizagem contínua for resolvida, um estágio que Liang Wenfeng chama de "singularidade" aparecerá: A capacidade do modelo será forte o suficiente para iterar a próxima versão do próprio modelo, fazer sua própria pesquisa e desenvolver uma próxima geração mais avançada.
Ele enfatizou especificamente que essa singularidade não é uma mutação repentina, mas um processo gradual e contínuo, embora seja convencionalmente chamada de singularidade.
Só depois disso vem a inteligência incorporada, onde os robôs realmente entram no mundo físico para fazer tarefas domésticas e cuidados com idosos.
Quanto ao motivo de seguirem essa ordem, Liang Wenfeng disse: Este é o caminho que exige menos esforço.
Ao resolver a aprendizagem contínua primeiro, a IA pode ajudar a acelerar cada etapa subsequente de pesquisa e desenvolvimento, para que os humanos não tenham que carregar tudo sozinhos.
Por outro lado, se eles fizessem a inteligência incorporada primeiro, esse seria um caminho amargo e cansativo construído sobre o trabalho humano, que a DeepSeek não quer escolher.
Há um detalhe aqui que vale a pena considerar: O objetivo principal da DeepSeek ao treinar a próxima versão do modelo não é para que os usuários externos o usem bem, mas para que sua própria equipe se desenvolva mais rápido.
O modelo serve primeiro à eficiência interna de P&D, e depois beneficia incidentalmente os usuários externos.
Essa ordem de prioridade, até certo ponto, determina a sequência de quase toda a alocação de recursos nesta empresa.
20.000 Cartões e um Fosso em Dissolução
Ao falar sobre a lacuna entre a China e os EUA, o julgamento de Liang Wenfeng foi muito direto: Talento não é o gargalo; poder computacional é.
A China não carece de talento em IA; a base é grande o suficiente, e a distribuição de pessoas inteligentes é aleatória. Não existe "todas as pessoas mais inteligentes foram para os EUA".
O verdadeiro gargalo são os recursos.
Os números são muito diretos: A DeepSeek atualmente tem cerca de 20.000 cartões de computação equivalentes à série H, a maioria dos quais chegou apenas no último mês ou dois.
Para treinar um modelo do mesmo nível dos maiores modelos atuais (com cerca de 800B de parâmetros ativados), são necessários 50.000 cartões GB300, ou 200.000 dos cartões mais recentes da Huawei. Isso é apenas para o treinamento em si, sem incluir os enormes custos experimentais durante a fase de pesquisa.
Os recursos atuais da DeepSeek podem suportar experimentos na escala de dezenas de bilhões de parâmetros ativados, o que ainda está uma ordem de magnitude longe de 800B.
Em relação aos chips nacionais, o julgamento de Liang Wenfeng foi inesperadamente otimista.
Ele acredita que o fosso ecológico da CUDA está sendo desmantelado por três forças simultaneamente: a própria IA pode ajudar a escrever código, reduzindo significativamente a barreira para construir um ecossistema; linguagens de alto nível como TileLang podem reescrever rapidamente todo o sistema de operadores da CUDA; cartões de jogos e cartões de computação compartilhavam originalmente uma arquitetura porque o mercado de computação de IA era menor que o de jogos, mas agora o mercado de computação é maior, e os dois não precisam mais estar atrelados — chips especializados estão se tornando mainstream.
Ele deu um julgamento de tempo específico: No próximo ano, o fato de que o ecossistema de chips nacionais está bom será provado pelos fatos.
O único obstáculo restante é a capacidade de produção.
A comparação específica de custo-benefício também é muito direta: O supernó 950 da Huawei pode substituir o GB200 e GB300 da NVIDIA em termos de desempenho e preço, ao custo de precisar de quatro cartões para igualar um, enquanto está dois anos atrasado. Não importa se for 50% a 200% mais caro, desde que possa ser comprado.
A DeepSeek atualmente obtém cerca de 16.000 cartões de capacidade da Huawei. Esse volume é equivalente a apenas 4.000 cartões NVIDIA, o que não é suficiente nem para treinar a próxima geração de modelos, mas é o suficiente para ajudar a Huawei a fazer o ecossistema funcionar primeiro.
Liang Wenfeng chama isso de "ajudar a Huawei a fazer isso bem primeiro". Ele não espera depender desses cartões para treinar modelos maiores; ele está pavimentando o caminho para o futuro.
Ainda mais interessante é a narrativa de recuperação que ele fornece: No passado, a IA chinesa usava um vigésimo do poder computacional de outros para produzir coisas comparáveis, enquanto ficava um a dois anos atrás.
No futuro, esse "tempo de atraso" precisa ser comprimido de um ou dois anos para três a seis meses, enquanto a lacuna de poder computacional permanece igualmente grande.
Não confiando em mais recursos, mas confiando em métodos mais inteligentes.
Essa abordagem de "usar a inteligência para preencher a lacuna" também se reflete na forma como a empresa se gerencia.
Metade dos Pesquisadores Principais Estão Rotulando Dados
Alguém perguntou a Liang Wenfeng se o problema de alucinação dos modelos grandes afetaria a experiência do usuário. A resposta dele foi muito franca: Alucinação não é um problema insolúvel. Pode ser melhorada com um pós-treinamento melhor; é só que ninguém colocou muito esforço para fazer isso ainda.
Dentro da DeepSeek, isso é classificado como um problema de produto; será resolvido, mas não é o foco.
Um detalhe mais digno de lembrar do que o problema da alucinação é: Metade dos pesquisadores principais da DeepSeek estão rotulando dados.
Isso não é porque rotular dados é barato na China. Pelo contrário, Liang Wenfeng disse que o custo da rotulagem de dados de alta qualidade na China não é diferente do dos EUA, especialmente para dados de ponta, onde não há vantagem de custo alguma.
Portanto, a estratégia atual é uma abordagem dupla: rotular primeiro os de baixo custo e deixar os de alto custo de lado por enquanto.
Ele julga que isso é uma questão de tempo, não de capital.
A OpenAI e a Anthropic começaram mais cedo e estão em execução há muito tempo. A China só começou a investir seriamente há cerca de seis meses, mas espera-se que a maior parte da lacuna possa ser fechada dentro de um ano.
Uma Empresa Sem Organização: O Que Mantém as Pessoas Unidas?
Liang Wenfeng disse que a DeepSeek "não tem organização" e é movida pela visão.
A operação específica: A gestão da empresa é dividida em duas linhas. Uma é de cima para baixo para projetos coletivos, como lançar o V4, que requer colaboração e divisão de trabalho de toda a equipe; esta parte é chamada de "formal". A outra é de baixo para cima, onde cada um pesquisa o que quiser; ninguém os gerencia e não há KPIs.
O padrão que Liang Wenfeng estabelece para si mesmo é: O trabalho formal não deve ocupar mais da metade do tempo de um funcionário.
Há duas considerações por trás disso.
Primeiro, a pesquisa requer um ambiente relaxado. Pressionar demais torna impossível explorar coisas novas. Como o objetivo é estimular o interesse espontâneo, deve-se deixar espaço para "pensamentos selvagens".
Segundo, a DeepSeek é focada o suficiente para que haja poucas coisas a fazer. Os produtos da empresa são geralmente imperfeitos, e eles não se esforçaram para corrigi-los, o que é em si uma escolha ativa.
Esse estilo organizacional não tem modelo para copiar.
Liang Wenfeng disse que a DeepSeek não imitou nenhuma empresa, incluindo os Laboratórios Bell, que são frequentemente usados como comparação, porque os Laboratórios Bell não precisavam ser responsáveis por seus próprios lucros e perdas, enquanto a DeepSeek é, em última análise, uma empresa que deve considerar como sobreviver. O governo não lhes dará um centavo sequer.
Cada escolha é um resultado calculado com base na situação real em questão, não uma resposta copiada.
Voltando àquela Comemoração
Olhando agora para a comemoração no dia do corte de preço do DDCP: Essa não foi uma história isolada; foi um microcosmo de todo o algoritmo de sobrevivência desta empresa.
Conter-se em não buscar a participação máxima é porque, em um mercado grande o suficiente, aqueles que são gananciosos serão espremidos primeiro.
Pegar gergelim sem parar é porque ficar olhando para ganhos imediatos impedirá que você veja as melancias maiores atrás.
Não fabricar chips ou aplicações verticais é porque comer demais leva a uma saída precoce.
Escolher a ordem que exige menos esforço para a rota técnica é porque a energia economizada pode ser usada onde os verdadeiros gargalos estão.
Ter metade dos pesquisadores rotulando dados é porque a lacuna que o poder computacional não pode preencher só pode ser preenchida com uma base mais sólida.
Essas decisões parecem não relacionadas na superfície, mas são, na verdade, diferentes maneiras de escrever a mesma frase: Em um caminho grande o suficiente, não calcular precisamente quanto você pode obter agora é o pré-requisito para obter mais.
Este é um método de julgamento que pode ser usado diretamente por qualquer pessoa em uma indústria competitiva.
Da próxima vez que você enfrentar uma escolha entre "quanto posso ganhar agora" e "quanto posso ganhar no futuro", não se apresse em calcular a conta imediata.
Faça uma pergunta mais fundamental: Este assunto, porque você está pegando demais agora, atrairá prematuramente um concorrente disposto a pegar menos?
Se a resposta for sim, então, por mais tentador que seja o ganho de curto prazo, não vale a pena trocar a probabilidade de sobrevivência por ele.


![[Memorando] Chefes estão cortando subordinados com baixo desempenho](https://youmind.club/__ym/cms-assets/media/1784827522698_408j7z_HN3Kb76awAAvvjF.jpg)


