Оптимізація кривої продуктивності передових моделей

@mustafasuleyman
АНГЛІЙСЬКА2 дні тому · 29 лип. 2026 р.
133K
250
32
21
72

Коротко

Мустафа Сулейман детально описує стратегію Microsoft AI щодо ефективності токенів та спеціалізованих моделей, наголошуючи на значній економії коштів та запуску сервісу Frontier Tuning.

Цього тижня MAI-Cyber-1-Flash у нашій обв'язці MDASH посів перше місце в бенчмарку CyberGym, обійшовши Mythos на 12 відсоткових пунктів, при витратах, що становлять лише 50%.

Такі оптимізації співвідношення продуктивності та вартості є ключовими для нової парадигми розгортання моделей. Останні кілька місяців основною темою було максимальне використання токенів (Tokenmaxxing). Ефективність використання токенів — це наступний великий фокус для всієї галузі.

Щоб побудувати передову компанію, потрібно оптимізувати продуктивність на рівні frontier відносно витрат. Вибір того, де ви хочете знаходитися на цій кривій, є критично важливим. Спільно оптимізуючи свої моделі, обв'язки та RLE, ви можете обрати точку на кривій, яка підходить вашій компанії.

Оскільки ми мчимо до світу, де передові компанії розгортають постійно активні агенти реального часу, які безперервно працюють у фоновому режимі, витрати на інференс різко зростуть.

У більшості випадків передові моделі загального призначення не потрібні для кожного завдання. Налаштовуючи моделі під конкретний продукт, ви можете підтримувати або навіть перевершувати продуктивність frontier-моделей, водночас різко знижуючи витрати на токени, іноді на 50% або більше.

Як щойно зазначив Сатья під час нашого звіту про прибутки за четвертий квартал, ми випустили понад десяток спеціалізованих моделей MAI у продуктах Microsoft з минулого кварталу. Усі вони зберігають або покращують якість порівняно з існуючими розгорнутими моделями, використовуючи значно менше токенів, у багатьох випадках заощаджуючи до 50-90% витрат на GPU.

Ось як працює машина для підйому на пагорб. Спільна оптимізація ваших власних моделей, у вашій власній обв'язці, з вашими даними та робочими процесами, навчених у ваших RLE. Ми вважаємо, що це новий ритм роботи передової компанії, і ми створюємо сервіс під назвою Frontier Tuning, який допоможе всім компаніям працювати таким чином.

Це маховик, який дозволить екосистемі frontier процвітати та бути більш стійкою, гарантуючи, що ви зможете змінювати моделі, створювати власну інтелектуальну власність і контролювати витрати.

Ось список деяких наших моделей, випущених цього кварталу, та їхній вплив на ефективність використання токенів:

  • MAI-Code-1-Flash забезпечує на 10% вищий рівень прийняття коду, ніж GPT-5.4 Mini та Claude Haiku 4.5 у VS Code, на 10% нижче медіанне використання токенів та збільшує утримання користувачів в середньому на 9%.
  • MAI-Code-1-Flash також є основою для нашої моделі Excel, яка забезпечує продуктивність, порівнянну з аналогічними моделями, при цьому обслуговуючись на H100, а не на GB.
  • MAI-Image-2.5-Flash знижує витрати на GPU до 84% у PowerPoint порівняно з GPT-Image-2. У OneDrive він забезпечує до 2.5-кратної ефективності токенів, скорочуючи затримку P95 на 25% порівняно з GPT-Image-1.5 та збільшуючи рівень збереження користувачами на 25%.
  • MAI-Voice-2-Flash забезпечує якість світового рівня, одночасно знижуючи витрати на GPU до 89%, будучи в 2 рази швидшим і на 32% дешевшим за свого попередника.
  • MAI-Transcribe-1.5 , який може працювати до 5 разів швидше за моделі конкурентів, постачається 58 мовами в продукті Dragon Copilot, який використовують 170 000 медичних працівників для майже 30 мільйонів прийомів пацієнтів.

Це було літо напруженої роботи в найзахопливіший час в історії нашої галузі. Чудова робота команди! Попереду ще багато, ми тільки починаємо.

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей