Optimización de la curva de rendimiento de vanguardia

@mustafasuleyman
INGLÉShace 2 días · 29 jul 2026
202K
283
40
24
79

TL;DR

Mustafa Suleyman detalla la estrategia de Microsoft AI para la eficiencia de tokens y modelos especializados, destacando ahorros de costos significativos y el lanzamiento del servicio Frontier Tuning.

Esta semana, MAI-Cyber-1-Flash dentro de nuestro arnés MDASH, alcanzó el No.1 en el benchmark CyberGym, superando a Mythos por 12 puntos porcentuales, con un 50% del costo.

Este tipo de optimizaciones de rendimiento-costo son centrales para el nuevo paradigma de despliegue de modelos. Tokenmaxxing ha sido la historia de los últimos meses. La eficiencia de tokens es el próximo gran enfoque en toda la industria.

Para construir una empresa de frontera, hay que optimizar el rendimiento de frontera frente al costo. Elegir dónde quieres situarte en esa curva es crítico. Al co-optimizar tus modelos, arneses y RLEs, puedes elegir un punto en la curva que se adapte a tu empresa.

A medida que corremos hacia un mundo donde las empresas de frontera despliegan agentes siempre activos, en tiempo real, operando continuamente en segundo plano, los costos de demanda de inferencia se van a disparar.

En la mayoría de los casos, los modelos generalistas de frontera no son necesarios para cada tarea. Al ajustar modelos para un producto específico, puedes mantener o incluso superar el rendimiento de frontera, mientras reduces drásticamente los costos de tokens, a veces hasta en un 50% o más.

Como Satya acaba de mencionar en nuestra llamada de ganancias del Q4, hemos enviado más de una docena de modelos MAI especializados en productos de Microsoft desde el último trimestre. Todos ellos mantienen o mejoran la calidad frente a los modelos desplegados existentes, mientras usan significativamente menos tokens, en muchos casos ahorrando hasta 50-90% de los costos de GPU.

Esta es la máquina de escalada de colinas en acción. Co-optimizar tus propios modelos, en tu propio arnés, con tus datos y flujos de trabajo, entrenados en tus RLEs. Creemos que este es el nuevo ritmo de una empresa de frontera, y estamos construyendo un servicio llamado Frontier Tuning, que ayudará a todas las empresas a trabajar de esta manera.

Este volante (flywheel) es lo que permitirá que el ecosistema de frontera prospere y sea más resiliente, asegurando que puedas intercambiar modelos, construir tu propia propiedad intelectual y controlar los costos.

Aquí hay una lista de algunos de nuestros modelos que se enviaron este trimestre y su impacto en la eficiencia de tokens:

  • MAI-Code-1-Flash ofrece una tasa de aceptación de código 10% más alta que GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, un 10% menos de uso mediano de tokens, y aumenta la retención en un 9% en promedio.
  • MAI-Code-1-Flash es también la base de nuestro modelo de Excel, que ofrece un rendimiento comparable a modelos similares, mientras se ejecuta en H100s, en lugar de GBs.
  • MAI-Image-2.5-Flash reduce los costos de GPU hasta en un 84% en PowerPoint frente a GPT-Image-2. En OneDrive ofrece hasta 2.5x de eficiencia de tokens mientras reduce la latencia P95 en un 25% frente a GPT-Image-1.5, y aumenta las tasas de guardado de usuarios en un 25%.
  • MAI-Voice-2-Flash ofrece calidad de clase mundial mientras reduce los costos de GPU hasta en un 89%, siendo 2 veces más rápido y 32% más barato que su predecesor.
  • MAI-Transcribe-1.5 que puede ejecutarse hasta 5 veces más rápido que los modelos competidores, se envía a 58 idiomas en el producto Dragon Copilot, que es utilizado por 170,000 proveedores médicos, para casi 30 millones de encuentros de pacientes.

Ha sido un verano de trabajo duro durante el momento más emocionante en la historia de nuestra industria. ¡Excelente trabajo del equipo! Mucho más por venir, apenas estamos empezando.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales