Ottimizzazione della curva delle prestazioni di frontiera

@mustafasuleyman
INGLESE22 ore fa · 29 lug 2026
133K
250
32
21
72

TL;DR

Mustafa Suleyman illustra la strategia di Microsoft AI per l'efficienza dei token e i modelli specializzati, evidenziando significativi risparmi sui costi e il lancio del servizio Frontier Tuning.

Questa settimana MAI-Cyber-1-Flash all'interno del nostro harness MDASH ha raggiunto il 1° posto nel benchmark CyberGym - superando Mythos di 12 punti percentuali - con il 50% dei costi.

Questo tipo di ottimizzazione costo-prestazioni è al centro del nuovo paradigma di deployment dei modelli. Tokenmaxxing è stata la storia degli ultimi mesi. L'efficienza dei token è il prossimo grande focus in tutto il settore.

Per costruire un'azienda all'avanguardia, devi ottimizzare le prestazioni di frontiera rispetto ai costi. Scegliere dove posizionarsi su quella curva è fondamentale. Co-ottimizzando i tuoi modelli, harness e RLE, puoi selezionare un punto sulla curva che si adatta alla tua azienda.

Mentre corriamo verso un mondo in cui le aziende all'avanguardia implementano agenti sempre attivi, in tempo reale, che operano continuamente in background, i costi della domanda di inferenza aumenteranno vertiginosamente.

Nella maggior parte dei casi, i modelli generalisti di frontiera non sono necessari per ogni attività. Ottimizzando i modelli per un prodotto specifico, puoi mantenere o persino superare le prestazioni di frontiera, riducendo drasticamente i costi dei token, a volte fino al 50% o più.

Come ha appena detto Satya durante la nostra chiamata sugli utili del Q4, abbiamo rilasciato oltre una dozzina di modelli MAI specializzati nei prodotti Microsoft dall'ultimo trimestre. Tutti mantengono o migliorano la qualità rispetto ai modelli esistenti, utilizzando significativamente meno token, in molti casi risparmiando fino al 50-90% dei costi GPU.

Questa è la macchina di hill-climbing in azione. Co-ottimizzare i tuoi modelli, nel tuo harness, con i tuoi dati e flussi di lavoro, addestrati nei tuoi RLE. Crediamo che questo sia il nuovo ritmo di un'azienda all'avanguardia, e stiamo costruendo un servizio chiamato Frontier Tuning, che aiuterà tutte le aziende a lavorare in questo modo.

Questo volano è ciò che permetterà all'ecosistema di frontiera di prosperare e di essere più resiliente, garantendo la possibilità di scambiare modelli, costruire la propria proprietà intellettuale e controllare i costi.

Ecco un elenco di alcuni dei nostri modelli rilasciati questo trimestre e l'impatto sull'efficienza dei token:

  • MAI-Code-1-Flash offre un tasso di accettazione del codice superiore del 10% rispetto a GPT-5.4 Mini e Claude Haiku 4.5 in VS Code, un utilizzo mediano dei token inferiore del 10%, e aumenta la retention in media del 9%.
  • MAI-Code-1-Flash è anche la base per il nostro modello Excel, che offre prestazioni paragonabili a modelli simili, pur essendo servito su H100, anziché su GB.
  • MAI-Image-2.5-Flash riduce i costi GPU fino all'84% in PowerPoint rispetto a GPT-Image-2. In OneDrive offre un'efficienza dei token fino a 2,5x riducendo la latenza P95 del 25% rispetto a GPT-Image-1.5 e aumentando il tasso di salvataggio degli utenti del 25%.
  • MAI-Voice-2-Flash offre una qualità di livello mondiale riducendo i costi GPU fino all'89%, pur essendo 2x più veloce e il 32% più economico del suo predecessore.
  • MAI-Transcribe-1.5 può funzionare fino a 5x più velocemente dei modelli concorrenti, ed è distribuito in 58 lingue nel prodotto Dragon Copilot, utilizzato da 170.000 operatori sanitari per quasi 30 milioni di visite pazienti.

È stata un'estate di duro lavoro nel periodo più entusiasmante della storia del nostro settore. Ottimo lavoro da parte del team! Molto altro verrà, siamo solo all'inizio.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali