Esta semana, o MAI-Cyber-1-Flash dentro do nosso harness MDASH, alcançou o 1º lugar no benchmark CyberGym - superando o Mythos por 12 pontos percentuais - com 50% do custo.
Esse tipo de otimização de desempenho-custo é central para o novo paradigma de implantação de modelos. Tokenmaxxing tem sido o tema dos últimos meses. A eficiência de tokens é o próximo grande foco em toda a indústria.
Para construir uma empresa de ponta, você precisa otimizar o desempenho de ponta em relação ao custo. Escolher onde você quer se posicionar nessa curva é crítico. Co-otimizando seus modelos, harnesses e RLEs, você pode escolher um ponto na curva que se adapte à sua empresa.
À medida que corremos em direção a um mundo onde empresas de ponta implantam agentes sempre ativos e em tempo real operando continuamente em segundo plano, os custos de demanda de inferência vão disparar.
Na maioria dos casos, modelos generalistas de ponta não são necessários para todas as tarefas. Ao ajustar modelos para um produto específico, você pode manter ou até superar o desempenho de ponta, enquanto reduz drasticamente os custos de tokens, às vezes em até 50% ou mais.
Como Satya acabou de mencionar em nossa teleconferência de resultados do Q4, enviamos mais de uma dúzia de modelos MAI especialistas em produtos Microsoft desde o último trimestre. Todos eles mantêm ou melhoram a qualidade em relação aos modelos implantados existentes, enquanto usam significativamente menos tokens, em muitos casos economizando até 50-90% dos custos de GPU.
Esta é a máquina de hill-climbing em ação. Co-otimizando seus próprios modelos, em seu próprio harness, com seus dados e fluxos de trabalho, treinados em seus RLEs. Acreditamos que este é o novo ritmo de uma empresa de ponta, e estamos construindo um serviço chamado Frontier Tuning, que ajudará todas as empresas a trabalharem dessa forma.
Esse flywheel é o que permitirá que o ecossistema de ponta prospere e se torne mais resiliente, garantindo que você possa trocar modelos, construir sua própria propriedade intelectual e controlar custos.
Aqui está uma lista de alguns dos nossos modelos que foram lançados neste trimestre e o impacto na eficiência de tokens:
- MAI-Code-1-Flash oferece uma taxa de aceitação de código 10% maior que o GPT-5.4 Mini e o Claude Haiku 4.5 no VS Code, uso mediano de tokens 10% menor, e aumenta a retenção em média 9%.
- MAI-Code-1-Flash também é a base para o nosso modelo Excel, que oferece desempenho comparável a modelos similares, sendo servido em H100s, em vez de GBs.
- MAI-Image-2.5-Flash reduz os custos de GPU em até 84% no PowerPoint em comparação com o GPT-Image-2. No OneDrive, oferece até 2,5x de eficiência de tokens enquanto reduz a latência P95 em 25% em relação ao GPT-Image-1.5, e aumenta as taxas de salvamento dos usuários em 25%.
- MAI-Voice-2-Flash oferece qualidade de classe mundial enquanto reduz os custos de GPU em até 89%, sendo 2x mais rápido e 32% mais barato que seu predecessor.
- MAI-Transcribe-1.5 que pode rodar até 5x mais rápido que modelos concorrentes, é enviado para 58 idiomas no produto Dragon Copilot, que é usado por 170 mil profissionais médicos, em quase 30 milhões de consultas de pacientes.
Foi um verão de muito trabalho durante o período mais emocionante da história da nossa indústria. Trabalho incrível da equipe! Muito mais por vir, estamos apenas começando.





