Optimización de la curva de rendimiento de vanguardia

@mustafasuleyman
INGLÉShace 22 horas · 29 jul 2026
133K
250
32
21
72

TL;DR

Mustafa Suleyman detalla la estrategia de Microsoft AI para la eficiencia de tokens y modelos especializados, destacando ahorros significativos de costes y el lanzamiento del servicio Frontier Tuning.

Esta semana, MAI-Cyber-1-Flash dentro de nuestro harness MDASH, alcanzó el No.1 en el benchmark CyberGym, superando a Mythos por 12 puntos porcentuales, con un 50% del costo.

Este tipo de optimizaciones entre rendimiento y costo son centrales en el nuevo paradigma de despliegue de modelos. Tokenmaxxing ha sido la historia de los últimos meses. La eficiencia de tokens es el siguiente gran enfoque en toda la industria.

Para construir una firma de frontera, debes optimizar el rendimiento de frontera en relación con el costo. Elegir dónde quieres situarte en esa curva es crítico. Co-optimizando tus modelos, harnesses y RLEs, puedes seleccionar un punto en la curva que se adapte a tu firma.

A medida que avanzamos hacia un mundo donde las firmas de frontera despliegan agentes en tiempo real, siempre activos y operando continuamente en segundo plano, los costos de demanda de inferencia se dispararán.

En la mayoría de los casos, los modelos generalistas de frontera no son necesarios para cada tarea. Al ajustar modelos para un producto específico, puedes mantener o incluso superar el rendimiento de frontera, mientras reduces drásticamente los costos de tokens, a veces hasta en un 50% o más.

Como Satya mencionó en nuestra llamada de resultados del Q4, hemos lanzado más de una docena de modelos MAI especializados en productos de Microsoft desde el último trimestre. Todos ellos mantienen o mejoran la calidad en comparación con los modelos desplegados existentes, mientras utilizan significativamente menos tokens, ahorrando en muchos casos hasta un 50-90% de los costos de GPU.

Esta es la máquina de escalada en acción. Co-optimizar tus propios modelos, en tu propio harness, con tus datos y flujos de trabajo, entrenados en tus RLEs. Creemos que este es el nuevo ritmo de una firma de frontera, y estamos construyendo un servicio llamado Frontier Tuning, que ayudará a todas las firmas a trabajar de esta manera.

Este volante es lo que permitirá que el ecosistema de frontera prospere y sea más resiliente, asegurando que puedas intercambiar modelos, construir tu propia propiedad intelectual y controlar los costos.

Aquí hay una lista de algunos de nuestros modelos lanzados este trimestre y su impacto en la eficiencia de tokens:

  • MAI-Code-1-Flash ofrece una tasa de aceptación de código un 10% más alta que GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, un 10% menos de uso mediano de tokens, y aumenta la retención en un 9% en promedio.
  • MAI-Code-1-Flash también es la base de nuestro modelo de Excel, que ofrece un rendimiento comparable a modelos similares, mientras se ejecuta en H100s, en lugar de GBs.
  • MAI-Image-2.5-Flash reduce los costos de GPU hasta en un 84% en PowerPoint frente a GPT-Image-2. En OneDrive ofrece hasta 2.5x de eficiencia de tokens mientras reduce la latencia P95 en un 25% frente a GPT-Image-1.5, y aumenta las tasas de guardado de usuarios en un 25%.
  • MAI-Voice-2-Flash ofrece una calidad de clase mundial mientras reduce los costos de GPU hasta en un 89%, siendo 2 veces más rápido y un 32% más barato que su predecesor.
  • MAI-Transcribe-1.5 que puede ejecutarse hasta 5 veces más rápido que los modelos de la competencia, se ha implementado en 58 idiomas en el producto Dragon Copilot, utilizado por 170 mil profesionales médicos, para casi 30 millones de consultas de pacientes.

Ha sido un verano de trabajo duro durante la época más emocionante en la historia de nuestra industria. ¡Excelente trabajo del equipo! Queda mucho más por venir, apenas estamos comenzando.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales