Otimizando a curva de desempenho de fronteira

@mustafasuleyman
INGLÊShá 1 dia · 29/07/2026
133K
250
32
21
72

TL;DR

Mustafa Suleyman detalha a estratégia da Microsoft AI para eficiência de tokens e modelos especializados, destacando economias significativas de custos e o lançamento do serviço Frontier Tuning.

Esta semana, o MAI-Cyber-1-Flash dentro do nosso harness MDASH alcançou o 1º lugar no benchmark CyberGym - superando o Mythos em 12 pontos percentuais - com 50% do custo.

Esse tipo de otimização entre performance e custo é central para o novo paradigma de implantação de modelos. Tokenmaxxing tem sido a história dos últimos meses. Eficiência de tokens é o próximo grande foco em toda a indústria.

Para construir uma empresa de fronteira, é preciso otimizar a performance de ponta em relação ao custo. Escolher onde você quer se posicionar nessa curva é fundamental. Co-otimizando seus modelos, harnesses e RLEs, você pode escolher um ponto na curva que melhor se adapta à sua empresa.

À medida que avançamos para um mundo onde empresas de fronteira implantam agentes sempre ativos e em tempo real, operando continuamente em segundo plano, os custos com demanda de inferência vão disparar.

Na maioria dos casos, modelos generalistas de fronteira não são necessários para todas as tarefas. Ao ajustar modelos para um produto específico, é possível manter ou até superar a performance de fronteira, reduzindo drasticamente os custos com tokens, às vezes em até 50% ou mais.

Como o Satya mencionou em nossa teleconferência de resultados do 4º trimestre, entregamos mais de uma dúzia de modelos MAI especialistas em produtos Microsoft desde o último trimestre. Todos eles mantêm ou melhoram a qualidade em relação aos modelos implantados existentes, ao mesmo tempo que usam significativamente menos tokens, economizando em muitos casos entre 50% e 90% dos custos de GPU.

Esta é a máquina de hill-climbing em ação. Co-otimizar seus próprios modelos, em seu próprio harness, com seus dados e fluxos de trabalho, treinados em seus RLEs. Acreditamos que este é o novo ritmo de uma empresa de fronteira, e estamos construindo um serviço chamado Frontier Tuning, que ajudará todas as empresas a trabalhar dessa forma.

Esse flywheel é o que permitirá que o ecossistema de fronteira prospere e seja mais resiliente, garantindo que você possa trocar modelos, construir sua própria propriedade intelectual e controlar custos.

Aqui está uma lista de alguns dos nossos modelos lançados neste trimestre e seu impacto em eficiência de tokens:

  • MAI-Code-1-Flash oferece uma taxa de aceitação de código 10% maior que o GPT-5.4 Mini e o Claude Haiku 4.5 no VS Code, 10% menor uso mediano de tokens, e aumenta a retenção em 9% na média.
  • MAI-Code-1-Flash também é a base do nosso modelo para Excel, que oferece performance comparável a modelos similares, sendo executado em H100s, em vez de GBs.
  • MAI-Image-2.5-Flash reduz os custos de GPU em até 84% no PowerPoint em comparação com o GPT-Image-2. No OneDrive, oferece eficiência de tokens de até 2,5x, ao mesmo tempo que reduz a latência P95 em 25% em relação ao GPT-Image-1.5 e aumenta as taxas de salvamento dos usuários em 25%.
  • MAI-Voice-2-Flash oferece qualidade de classe mundial enquanto reduz os custos de GPU em até 89%, sendo 2x mais rápido e 32% mais barato que seu antecessor.
  • MAI-Transcribe-1.5, que pode ser executado até 5x mais rápido que modelos concorrentes, foi implantado em 58 idiomas no produto Dragon Copilot, usado por 170 mil profissionais de saúde em quase 30 milhões de consultas com pacientes.

Foi um verão de trabalho duro durante o período mais empolgante da história da nossa indústria. Trabalho incrível da equipe! Muito mais está por vir, estamos apenas começando.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais