Оптимизация кривой производительности передовых моделей

@mustafasuleyman
АНГЛИЙСКИЙ2 дня назад · 29 июл. 2026 г.
133K
250
32
21
72

Суть

Мустафа Сулейман подробно описывает стратегию Microsoft AI в области эффективности токенов и специализированных моделей, подчеркивая значительную экономию затрат и запуск сервиса Frontier Tuning.

На этой неделе MAI-Cyber-1-Flash в нашем инструментарии MDASH занял первое место в бенчмарке CyberGym, обогнав Mythos на 12 процентных пунктов при 50% затрат.

Такие оптимизации производительности и стоимости лежат в основе новой парадигмы развертывания моделей. Токенмаксинг был главной темой последних месяцев. Эффективность использования токенов — следующий крупный фокус всей индустрии.

Чтобы построить передовую компанию, нужно оптимизировать производительность на переднем крае относительно затрат. Выбор точки на этой кривой критически важен. Совместно оптимизируя свои модели, инструментарий и RLE, можно занять позицию на кривой, которая подходит именно вашей компании.

По мере того как мы движемся к миру, где передовые фирмы развертывают постоянно работающих, реальных агентов, действующих непрерывно в фоне, затраты на инференс взлетят до небес.

В большинстве случаев универсальные модели переднего края не нужны для каждой задачи. Настраивая модели под конкретный продукт, можно сохранить или даже превзойти производительность переднего края, при этом радикально снизив затраты на токены — иногда на 50% и более.

Как только что упомянул Сатья на нашем отчете за четвертый квартал, мы выпустили более десятка специализированных моделей MAI в продуктах Microsoft с прошлого квартала. Все они сохраняют или улучшают качество по сравнению с существующими развернутыми моделями, используя при этом значительно меньше токенов, во многих случаях экономя 50–90% затрат на GPU.

Это и есть та самая оптимизационная машина в действии. Совместная оптимизация собственных моделей, в собственном инструментарии, с вашими данными и рабочими процессами, обученная на ваших RLE. Мы считаем, что это новый ритм передовой компании, и мы создаем сервис под названием Frontier Tuning, который поможет всем компаниям работать так же.

Этот цикл позволит экосистеме передовых компаний процветать и стать более устойчивой, гарантируя возможность менять модели, создавать собственный интеллектуальный капитал и контролировать затраты.

Вот список некоторых моделей, выпущенных в этом квартале, и их влияние на эффективность токенов:

  • MAI-Code-1-Flash обеспечивает на 10% более высокий уровень принятия кода, чем GPT-5.4 Mini и Claude Haiku 4.5 в VS Code, на 10% меньшее медианное использование токенов и увеличивает удержание пользователей в среднем на 9%.
  • MAI-Code-1-Flash также является основой для нашей модели Excel, которая демонстрирует производительность, сопоставимую с аналогичными моделями, при этом обслуживается на H100, а не на GB.
  • MAI-Image-2.5-Flash снижает затраты на GPU до 84% в PowerPoint по сравнению с GPT-Image-2. В OneDrive обеспечивает до 2,5-кратной эффективности токенов, одновременно снижая задержку P95 на 25% по сравнению с GPT-Image-1.5 и увеличивая процент сохранений пользователями на 25%.
  • MAI-Voice-2-Flash обеспечивает качество мирового уровня, снижая затраты на GPU до 89%, будучи при этом в 2 раза быстрее и на 32% дешевле своего предшественника.
  • MAI-Transcribe-1.5 может работать до 5 раз быстрее конкурирующих моделей, развернут на 58 языках в продукте Dragon Copilot, который используется 170 000 медицинскими специалистами для почти 30 миллионов приемов пациентов.

Это было лето напряженной работы в самое захватывающее время в истории нашей отрасли. Отличная работа команды! Впереди еще многое — мы только начинаем.

Переделать в YouMind

Превратите одну вирусную статью в полноценный рабочий процесс создания контента

Собирайте источники, расшифровывайте паттерны, создавайте активы, пишите черновики и публикуйте контент из одного рабочего пространства ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи