Esta semana, MAI-Cyber-1-Flash dentro de nuestro arnés MDASH, alcanzó el No.1 en el benchmark CyberGym, superando a Mythos por 12 puntos porcentuales, con un 50% del costo.
Este tipo de optimizaciones de rendimiento-costo son centrales para el nuevo paradigma de despliegue de modelos. Tokenmaxxing ha sido la historia de los últimos meses. La eficiencia de tokens es el próximo gran enfoque en toda la industria.
Para construir una empresa de frontera, hay que optimizar el rendimiento de frontera frente al costo. Elegir dónde quieres situarte en esa curva es crítico. Al co-optimizar tus modelos, arneses y RLEs, puedes elegir un punto en la curva que se adapte a tu empresa.
A medida que corremos hacia un mundo donde las empresas de frontera despliegan agentes siempre activos, en tiempo real, operando continuamente en segundo plano, los costos de demanda de inferencia se van a disparar.
En la mayoría de los casos, los modelos generalistas de frontera no son necesarios para cada tarea. Al ajustar modelos para un producto específico, puedes mantener o incluso superar el rendimiento de frontera, mientras reduces drásticamente los costos de tokens, a veces hasta en un 50% o más.
Como Satya acaba de mencionar en nuestra llamada de ganancias del Q4, hemos enviado más de una docena de modelos MAI especializados en productos de Microsoft desde el último trimestre. Todos ellos mantienen o mejoran la calidad frente a los modelos desplegados existentes, mientras usan significativamente menos tokens, en muchos casos ahorrando hasta 50-90% de los costos de GPU.
Esta es la máquina de escalada de colinas en acción. Co-optimizar tus propios modelos, en tu propio arnés, con tus datos y flujos de trabajo, entrenados en tus RLEs. Creemos que este es el nuevo ritmo de una empresa de frontera, y estamos construyendo un servicio llamado Frontier Tuning, que ayudará a todas las empresas a trabajar de esta manera.
Este volante (flywheel) es lo que permitirá que el ecosistema de frontera prospere y sea más resiliente, asegurando que puedas intercambiar modelos, construir tu propia propiedad intelectual y controlar los costos.
Aquí hay una lista de algunos de nuestros modelos que se enviaron este trimestre y su impacto en la eficiencia de tokens:
- MAI-Code-1-Flash ofrece una tasa de aceptación de código 10% más alta que GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, un 10% menos de uso mediano de tokens, y aumenta la retención en un 9% en promedio.
- MAI-Code-1-Flash es también la base de nuestro modelo de Excel, que ofrece un rendimiento comparable a modelos similares, mientras se ejecuta en H100s, en lugar de GBs.
- MAI-Image-2.5-Flash reduce los costos de GPU hasta en un 84% en PowerPoint frente a GPT-Image-2. En OneDrive ofrece hasta 2.5x de eficiencia de tokens mientras reduce la latencia P95 en un 25% frente a GPT-Image-1.5, y aumenta las tasas de guardado de usuarios en un 25%.
- MAI-Voice-2-Flash ofrece calidad de clase mundial mientras reduce los costos de GPU hasta en un 89%, siendo 2 veces más rápido y 32% más barato que su predecesor.
- MAI-Transcribe-1.5 que puede ejecutarse hasta 5 veces más rápido que los modelos competidores, se envía a 58 idiomas en el producto Dragon Copilot, que es utilizado por 170,000 proveedores médicos, para casi 30 millones de encuentros de pacientes.
Ha sido un verano de trabajo duro durante el momento más emocionante en la historia de nuestra industria. ¡Excelente trabajo del equipo! Mucho más por venir, apenas estamos empezando.





