Otimizando a curva de desempenho de fronteira

@mustafasuleyman
INGLÊShá 2 dias · 29 de jul. de 2026
202K
283
40
24
79

TL;DR

Mustafa Suleyman detalha a estratégia da Microsoft AI para eficiência de tokens e modelos especializados, destacando economias significativas de custos e o lançamento do serviço Frontier Tuning.

Esta semana, o MAI-Cyber-1-Flash dentro do nosso harness MDASH, alcançou o 1º lugar no benchmark CyberGym - superando o Mythos por 12 pontos percentuais - com 50% do custo.

Esse tipo de otimização de desempenho-custo é central para o novo paradigma de implantação de modelos. Tokenmaxxing tem sido o tema dos últimos meses. A eficiência de tokens é o próximo grande foco em toda a indústria.

Para construir uma empresa de ponta, você precisa otimizar o desempenho de ponta em relação ao custo. Escolher onde você quer se posicionar nessa curva é crítico. Co-otimizando seus modelos, harnesses e RLEs, você pode escolher um ponto na curva que se adapte à sua empresa.

À medida que corremos em direção a um mundo onde empresas de ponta implantam agentes sempre ativos e em tempo real operando continuamente em segundo plano, os custos de demanda de inferência vão disparar.

Na maioria dos casos, modelos generalistas de ponta não são necessários para todas as tarefas. Ao ajustar modelos para um produto específico, você pode manter ou até superar o desempenho de ponta, enquanto reduz drasticamente os custos de tokens, às vezes em até 50% ou mais.

Como Satya acabou de mencionar em nossa teleconferência de resultados do Q4, enviamos mais de uma dúzia de modelos MAI especialistas em produtos Microsoft desde o último trimestre. Todos eles mantêm ou melhoram a qualidade em relação aos modelos implantados existentes, enquanto usam significativamente menos tokens, em muitos casos economizando até 50-90% dos custos de GPU.

Esta é a máquina de hill-climbing em ação. Co-otimizando seus próprios modelos, em seu próprio harness, com seus dados e fluxos de trabalho, treinados em seus RLEs. Acreditamos que este é o novo ritmo de uma empresa de ponta, e estamos construindo um serviço chamado Frontier Tuning, que ajudará todas as empresas a trabalharem dessa forma.

Esse flywheel é o que permitirá que o ecossistema de ponta prospere e se torne mais resiliente, garantindo que você possa trocar modelos, construir sua própria propriedade intelectual e controlar custos.

Aqui está uma lista de alguns dos nossos modelos que foram lançados neste trimestre e o impacto na eficiência de tokens:

  • MAI-Code-1-Flash oferece uma taxa de aceitação de código 10% maior que o GPT-5.4 Mini e o Claude Haiku 4.5 no VS Code, uso mediano de tokens 10% menor, e aumenta a retenção em média 9%.
  • MAI-Code-1-Flash também é a base para o nosso modelo Excel, que oferece desempenho comparável a modelos similares, sendo servido em H100s, em vez de GBs.
  • MAI-Image-2.5-Flash reduz os custos de GPU em até 84% no PowerPoint em comparação com o GPT-Image-2. No OneDrive, oferece até 2,5x de eficiência de tokens enquanto reduz a latência P95 em 25% em relação ao GPT-Image-1.5, e aumenta as taxas de salvamento dos usuários em 25%.
  • MAI-Voice-2-Flash oferece qualidade de classe mundial enquanto reduz os custos de GPU em até 89%, sendo 2x mais rápido e 32% mais barato que seu predecessor.
  • MAI-Transcribe-1.5 que pode rodar até 5x mais rápido que modelos concorrentes, é enviado para 58 idiomas no produto Dragon Copilot, que é usado por 170 mil profissionais médicos, em quase 30 milhões de consultas de pacientes.

Foi um verão de muito trabalho durante o período mais emocionante da história da nossa indústria. Trabalho incrível da equipe! Muito mais por vir, estamos apenas começando.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais