Diese Woche landete MAI-Cyber-1-Flash in unserem MDASH-Harness auf Platz 1 des CyberGym-Benchmarks – und schlug Mythos um 12 Prozentpunkte – bei 50 % der Kosten.
Diese Art von Leistungs-Kosten-Optimierung steht im Zentrum des neuen Paradigmas für die Modellbereitstellung. Tokenmaxxing war in den letzten Monaten die große Geschichte. Token-Effizienz ist der nächste große Schwerpunkt der gesamten Branche.
Um ein Frontier-Unternehmen aufzubauen, muss man die Spitzenleistung gegen die Kosten optimieren. Entscheidend ist, wo man sich auf dieser Kurve positionieren möchte. Durch die Co-Optimierung von Modellen, Harnesses und RLEs kann man einen Punkt auf der Kurve wählen, der zum eigenen Unternehmen passt.
Während wir auf eine Welt zusteuern, in der Frontier-Unternehmen rund um die Uhr aktive Echtzeit-Agenten im Hintergrund einsetzen, werden die Kosten für Inferenzanfragen explodieren.
In den meisten Fällen sind Frontier-Generalistenmodelle nicht für jede Aufgabe nötig. Indem man Modelle für ein bestimmtes Produkt optimiert, kann man die Frontier-Leistung halten oder sogar übertreffen, während die Token-Kosten drastisch gesenkt werden – manchmal um 50 % oder mehr.
Wie Satya gerade in unserer Q4-Telefonkonferenz erwähnt hat, haben wir seit letztem Quartal über ein Dutzend spezialisierte MAI-Modelle in Microsoft-Produkten ausgeliefert. Alle davon halten oder verbessern die Qualität im Vergleich zu bestehenden Modellen, verbrauchen aber deutlich weniger Token – in vielen Fällen sparen sie 50–90 % der GPU-Kosten.
Das ist die Hill-Climbing-Maschine in Aktion: Die eigenen Modelle im eigenen Harness mit den eigenen Daten und Workflows optimieren, trainiert in den eigenen RLEs. Wir glauben, das ist der neue Rhythmus eines Frontier-Unternehmens, und wir bauen einen Dienst namens Frontier Tuning, der allen Unternehmen helfen wird, so zu arbeiten.
Dieses Schwungrad wird es dem Frontier-Ökosystem ermöglichen, zu gedeihen und widerstandsfähiger zu werden, sodass man Modelle austauschen, eigenes geistiges Eigentum aufbauen und die Kosten kontrollieren kann.
Hier ist eine Liste einiger unserer Modelle, die in diesem Quartal ausgeliefert wurden, und ihre Auswirkungen auf die Token-Effizienz:
- MAI-Code-1-Flash liefert eine 10 % höhere Code-Akzeptanzrate als GPT-5.4 Mini und Claude Haiku 4.5 in VS Code, 10 % niedrigeren medianen Tokenverbrauch und steigert die Retention im Durchschnitt um 9 %.
- MAI-Code-1-Flash ist auch die Grundlage für unser Excel-Modell, das eine vergleichbare Leistung wie ähnliche Modelle bietet, dabei aber auf H100s statt auf GBs bereitgestellt wird.
- MAI-Image-2.5-Flash senkt die GPU-Kosten in PowerPoint um bis zu 84 % gegenüber GPT-Image-2. In OneDrive erzielt es eine bis zu 2,5-fache Token-Effizienz, während die P95-Latenz um 25 % gegenüber GPT-Image-1.5 gesenkt und die Benutzer-Speicherrate um 25 % erhöht wird.
- MAI-Voice-2-Flash bietet Weltklasse-Qualität bei gleichzeitiger Reduzierung der GPU-Kosten um bis zu 89 %, ist 2x schneller und 32 % günstiger als sein Vorgänger.
- MAI-Transcribe-1.5 kann bis zu 5x schneller als Konkurrenzmodelle laufen und wird in 58 Sprachen im Dragon Copilot-Produkt ausgeliefert, das von 170.000 medizinischen Anbietern bei fast 30 Millionen Patientenkontakten genutzt wird.
Es war ein Sommer harter Arbeit in der aufregendsten Zeit in der Geschichte unserer Branche. Großartige Arbeit des Teams! Es kommt noch viel mehr – wir fangen gerade erst an.





