На этой неделе MAI-Cyber-1-Flash в нашем инструментарии MDASH занял первое место в бенчмарке CyberGym, обогнав Mythos на 12 процентных пунктов при 50% затрат.
Такие оптимизации производительности и стоимости лежат в основе новой парадигмы развертывания моделей. Токенмаксинг был главной темой последних месяцев. Эффективность использования токенов — следующий крупный фокус всей индустрии.
Чтобы построить передовую компанию, нужно оптимизировать производительность на переднем крае относительно затрат. Выбор точки на этой кривой критически важен. Совместно оптимизируя свои модели, инструментарий и RLE, можно занять позицию на кривой, которая подходит именно вашей компании.
По мере того как мы движемся к миру, где передовые фирмы развертывают постоянно работающих, реальных агентов, действующих непрерывно в фоне, затраты на инференс взлетят до небес.
В большинстве случаев универсальные модели переднего края не нужны для каждой задачи. Настраивая модели под конкретный продукт, можно сохранить или даже превзойти производительность переднего края, при этом радикально снизив затраты на токены — иногда на 50% и более.
Как только что упомянул Сатья на нашем отчете за четвертый квартал, мы выпустили более десятка специализированных моделей MAI в продуктах Microsoft с прошлого квартала. Все они сохраняют или улучшают качество по сравнению с существующими развернутыми моделями, используя при этом значительно меньше токенов, во многих случаях экономя 50–90% затрат на GPU.
Это и есть та самая оптимизационная машина в действии. Совместная оптимизация собственных моделей, в собственном инструментарии, с вашими данными и рабочими процессами, обученная на ваших RLE. Мы считаем, что это новый ритм передовой компании, и мы создаем сервис под названием Frontier Tuning, который поможет всем компаниям работать так же.
Этот цикл позволит экосистеме передовых компаний процветать и стать более устойчивой, гарантируя возможность менять модели, создавать собственный интеллектуальный капитал и контролировать затраты.
Вот список некоторых моделей, выпущенных в этом квартале, и их влияние на эффективность токенов:
- MAI-Code-1-Flash обеспечивает на 10% более высокий уровень принятия кода, чем GPT-5.4 Mini и Claude Haiku 4.5 в VS Code, на 10% меньшее медианное использование токенов и увеличивает удержание пользователей в среднем на 9%.
- MAI-Code-1-Flash также является основой для нашей модели Excel, которая демонстрирует производительность, сопоставимую с аналогичными моделями, при этом обслуживается на H100, а не на GB.
- MAI-Image-2.5-Flash снижает затраты на GPU до 84% в PowerPoint по сравнению с GPT-Image-2. В OneDrive обеспечивает до 2,5-кратной эффективности токенов, одновременно снижая задержку P95 на 25% по сравнению с GPT-Image-1.5 и увеличивая процент сохранений пользователями на 25%.
- MAI-Voice-2-Flash обеспечивает качество мирового уровня, снижая затраты на GPU до 89%, будучи при этом в 2 раза быстрее и на 32% дешевле своего предшественника.
- MAI-Transcribe-1.5 может работать до 5 раз быстрее конкурирующих моделей, развернут на 58 языках в продукте Dragon Copilot, который используется 170 000 медицинскими специалистами для почти 30 миллионов приемов пациентов.
Это было лето напряженной работы в самое захватывающее время в истории нашей отрасли. Отличная работа команды! Впереди еще многое — мы только начинаем.





