Esta semana, o MAI-Cyber-1-Flash dentro do nosso harness MDASH alcançou o 1º lugar no benchmark CyberGym - superando o Mythos em 12 pontos percentuais - com 50% do custo.
Esse tipo de otimização entre performance e custo é central para o novo paradigma de implantação de modelos. Tokenmaxxing tem sido a história dos últimos meses. Eficiência de tokens é o próximo grande foco em toda a indústria.
Para construir uma empresa de fronteira, é preciso otimizar a performance de ponta em relação ao custo. Escolher onde você quer se posicionar nessa curva é fundamental. Co-otimizando seus modelos, harnesses e RLEs, você pode escolher um ponto na curva que melhor se adapta à sua empresa.
À medida que avançamos para um mundo onde empresas de fronteira implantam agentes sempre ativos e em tempo real, operando continuamente em segundo plano, os custos com demanda de inferência vão disparar.
Na maioria dos casos, modelos generalistas de fronteira não são necessários para todas as tarefas. Ao ajustar modelos para um produto específico, é possível manter ou até superar a performance de fronteira, reduzindo drasticamente os custos com tokens, às vezes em até 50% ou mais.
Como o Satya mencionou em nossa teleconferência de resultados do 4º trimestre, entregamos mais de uma dúzia de modelos MAI especialistas em produtos Microsoft desde o último trimestre. Todos eles mantêm ou melhoram a qualidade em relação aos modelos implantados existentes, ao mesmo tempo que usam significativamente menos tokens, economizando em muitos casos entre 50% e 90% dos custos de GPU.
Esta é a máquina de hill-climbing em ação. Co-otimizar seus próprios modelos, em seu próprio harness, com seus dados e fluxos de trabalho, treinados em seus RLEs. Acreditamos que este é o novo ritmo de uma empresa de fronteira, e estamos construindo um serviço chamado Frontier Tuning, que ajudará todas as empresas a trabalhar dessa forma.
Esse flywheel é o que permitirá que o ecossistema de fronteira prospere e seja mais resiliente, garantindo que você possa trocar modelos, construir sua própria propriedade intelectual e controlar custos.
Aqui está uma lista de alguns dos nossos modelos lançados neste trimestre e seu impacto em eficiência de tokens:
- MAI-Code-1-Flash oferece uma taxa de aceitação de código 10% maior que o GPT-5.4 Mini e o Claude Haiku 4.5 no VS Code, 10% menor uso mediano de tokens, e aumenta a retenção em 9% na média.
- MAI-Code-1-Flash também é a base do nosso modelo para Excel, que oferece performance comparável a modelos similares, sendo executado em H100s, em vez de GBs.
- MAI-Image-2.5-Flash reduz os custos de GPU em até 84% no PowerPoint em comparação com o GPT-Image-2. No OneDrive, oferece eficiência de tokens de até 2,5x, ao mesmo tempo que reduz a latência P95 em 25% em relação ao GPT-Image-1.5 e aumenta as taxas de salvamento dos usuários em 25%.
- MAI-Voice-2-Flash oferece qualidade de classe mundial enquanto reduz os custos de GPU em até 89%, sendo 2x mais rápido e 32% mais barato que seu antecessor.
- MAI-Transcribe-1.5, que pode ser executado até 5x mais rápido que modelos concorrentes, foi implantado em 58 idiomas no produto Dragon Copilot, usado por 170 mil profissionais de saúde em quase 30 milhões de consultas com pacientes.
Foi um verão de trabalho duro durante o período mais empolgante da história da nossa indústria. Trabalho incrível da equipe! Muito mais está por vir, estamos apenas começando.





