Лучшая модель для задачи — это почти никогда не самая лучшая модель в рейтинге.
В мире AI Рождество наступает примерно раз в неделю. Выходит новая модель, все смотрят на одни и те же бенчмарки с ложной точностью, и мы дружно признаём её величайшим изобретением, пока на следующей неделе не повторяем то же самое.
Но ни один из этих графиков не отвечает на единственный важный вопрос. Может ли модель действительно выполнять вашу ежедневную сводку или отправлять коммерческое предложение клиенту? В Hyperagent мы даём вам доступ ко всем этим моделям поверх первоклассного агента. Поэтому мы протестировали их сами. Четырнадцать моделей, сорок два прогона, на реальных задачах, которые наши клиенты ежедневно поручают агентам. Выявились три факта.
- Счёт за одинаковую работу различался в 50 раз. Один и тот же набор тестов обошёлся в $1.48 на Qwen 3.7 Plus и в $75.16 на Fable 5.
- Победитель бенчмарков не был победителем в работе. GPT 5.6 Sol возглавил наши базовые тесты, но не попал в тройку лидеров, когда выполнял реальные задачи внутри Hyperagent. Grok 4.5 был середняком на базовых тестах, но вышел на первое место по качеству готовой работы, скорости и стоимости.
- И ни одна модель не выиграла во всём. Правильный выбор зависел от задачи.
Вывод — не новая любимая модель. Это способ решать, какая из них оправдывает свою стоимость применительно к каждой конкретной задаче.
Карта AI-моделей для интеллектуальной работы
Любая задача, которую вы поручаете агенту, сводится к двум вопросам: сколько суждений она требует и как часто выполняется? Постройте эти две оси, и интеллектуальная работа распадётся на четыре зоны, каждой из которых нужна своя модель.

Объёмная работа (верхний левый угол). Триаж, мониторинг, маршрутизация, синхронизация данных. Чёткая процедура, выполняется постоянно, и ошибка обходится дёшево. Здесь нужна быстрая и недорогая модель.
Ежедневное мастерство (верхний правый угол). Составление документов, отчёты, исследования, коммуникация с клиентами. Повторяющаяся интеллектуальная работа, которая занимает большую часть недели — требует реального синтеза и хорошего стиля письма, выполняется надёжно и часто.
Высокие ставки (нижний правый угол). Проверка контрактов, ценообразование, глубокий анализ. Редкие задачи, но неверный ответ стоит клиента, контракта или квартальной маржи. Здесь потенциальный ущерб намного превышает стоимость модели, и именно здесь самые дорогие модели оправдывают свою цену.
Не оптимизировать (нижний левый угол). Изредка возникающие простые запросы, где любая адекватная модель справится, а разница в цене слишком мала, чтобы заслуживать решения. Это единственный квадрат на карте, о котором мы советуем не задумываться.
Три класса моделей
Из карты вытекают три рабочих класса. Они описывают экономику и профиль сложности задачи, а не оценивают модель как хорошую или плохую.
Спринтеры созданы для объёмной работы — быстрые, дешёвые и стабильные, когда процедура ясна, а ошибку легко исправить. Haiku 4.5, Gemini 3.5 Flash и DeepSeek V4 Pro.
Середняки выполняют ежедневное мастерство. Они синтезируют источники, удерживают многошаговый план и хорошо пишут, не требуя ставок топ-уровня за каждый отчёт. Sonnet 5, GPT 5.6 Terra, Grok 4.5 и GLM 5.2 — сюда относится большая часть интеллектуальной работы.
Тяжеловесы берут на себя задачи с высокими ставками, обеспечивая более сильное обоснование и больше времени на размышления в работе, где неверный ответ стоит гораздо дороже, чем счёт за модель. Opus 4.8, GPT 5.6 Sol и Fable 5.
Инстинкт большинства людей — начать с самого верха и спускаться вниз: запустить всё на Fable 5 или Opus 4.8, получить желаемый результат, а затем пробовать более дешёвые модели, пока качество не упадёт. Это работает, но мы обнаружили, что большинству задач это не нужно. Как только вы можете назвать задачу и разместить её на карте, вы обычно можете начать с правильного класса с самого начала. Для ежедневного мастерства, которое составляет большую часть вашей работы, это означает начать с надёжного середняка вроде Sonnet 5. К нисходящему поиску вы прибегаете только тогда, когда задача действительно находится в зоне высоких ставок.
Поле шире, чем Claude, GPT и Gemini
Большинство команд по умолчанию используют те несколько названий моделей, которые они уже знают. Это разумная отправная точка, но она оставляет нетронутым большую часть списка — и некоторые модели, выполняющие наиболее полезную работу в Hyperagent, не являются широко известными. Вот наши рабочие впечатления от тестов и повседневного использования, а также работа, которую мы наблюдали у клиентов.
Grok 4.5 — это быстрый, оперативный поиск. Он быстро работает с задачами, требующими большого количества инструментов, и показал особенно хорошие результаты в паре с родным Exa Search от Hyperagent. У него также есть прямой доступ к X, поэтому вопрос о текущих настроениях может вернуться с реальными постами, стоящими за ответом. Он возглавил наш рейтинг качества готовой работы при стоимости $9.71 за полный прогон.
Muse Spark 1.1 пишет чисто и проверяет себя. Он занял второе место в тестах, и наше первое впечатление — лаконичная, хорошо структурированная проза с полезной привычкой проверять свою работу перед выдачей. Он ещё новый, поэтому мы бы рекомендовали начинать с ним на контролируемых повседневных задачах, прежде чем доверять длительные задания без присмотра.
Kimi K2.6 — это глубокие исследования по цене открытой модели. Он выполняет поиск параллельно и собирает свидетельства в единый ответ, не взимая плату по ставкам флагманских моделей, что делает его сильным специалистом по исследованиям. Его единственное реальное ограничение — размер документа, с контекстом до 256 000 токенов.
GLM 5.2 — это выбор с точки зрения ценности. Он оказался на удивление близок к закрытым середнякам в рутинных исследованиях, составлении текстов и работе с длинными документами примерно за треть цены, а его проза — одна из лучших за пределами Sonnet и Opus. Он стал ежедневным рабочим инструментом для многих в команде Hyperagent.
Qwen 3.7 Plus — это работник экрана. Он особенно хорош в поиске кнопок, полей и меню на отображаемых страницах и недорог для структурированного извлечения данных — он произвёл самый дешёвый полный прогон в нашем тесте. Обращайтесь к нему, когда задача связана с работой интерфейса или перемещением данных, а не когда важен голос.
DeepSeek V4 Pro — это структурированный анализ по очень низкой цене. Он сильнее всего в сверке, очистке данных, плановой работе с числами и подобных структурированных задачах. Его стиль письма буквален и лаконичен, что хорошо для внутренних объяснений, но плохо для клиентской прозы. Специалист, и очень экономичный.
Укомплектовываем ваших постоянно работающих агентов по правильной цене
Стив Джуба управляет туристической компанией из шести человек. Он создал агента для подготовки сводок, подключённого к восьми источникам данных в реальном времени, который запускается несколько раз в день, и это сократило его утренний сбор контекста с более чем трёх часов по восьми вкладкам до пятнадцати минут.
Такой агент читает гораздо больше, чем пишет, и выполняет одну и ту же работу сотни раз в год, поэтому небольшая разница в цене за прогон перестаёт быть погрешностью округления и превращается в реальную статью бюджета. Рассмотрим сводку, которая читает 100 000 токенов и пишет 2 000 каждый день. По прейскурантным ценам июля 2026 года такая работа будет стоить примерно:
- $16 в год на Qwen 3.7 Plus (спринтер)
- $38 в год на Kimi K2.6 (середняк)
- $40 в год на Haiku 4.5 (спринтер)
- $80 в год на Sonnet 5 (середняк)

Модели с открытыми весами меняют расчёты для такой работы с интенсивным чтением. Kimi K2.6 выполняет исследования и синтез на уровне середняка за $38 на этой задаче — это меньше половины стоимости Sonnet 5 и примерно столько же, сколько стоит спринтер Haiku. Вы не жертвуете качеством суждений ради цены; вы получаете работу середняка по цене спринтера. Если бы задача была чистым извлечением данных без необходимости суждений, Qwen выполнил бы её за $16 — но как только требуется реальный синтез, Kimi даёт его вам почти за ту же цену.
Меняем модель, сохраняем агента
Всё это не имеет значения, если смена модели означает перестройку агента. Внутри Hyperagent это не так, потому что модель — это всего лишь одна настройка, а роль находится над ней. При смене модели агент сохраняет всё, что делает его полезным:
- Его инструкции и область действия
- Его навыки, скрипты и рабочие процедуры
- Его память об исправлениях
- Его справочные файлы и корпоративный контекст
- Его связи с системами, где находится работа
- Его критерии оценки качества

Это превращает выбор модели в тест, а не в миграцию. Один и тот же агент может выполнять одну и ту же задачу на двух моделях без перестройки, поэтому вы можете найти самую дешёвую, которая соответствует вашим стандартам, вместо того чтобы гадать.
Это также позволяет дорогой части сложного рабочего процесса окупиться один раз. Когда задача действительно требует этого, используйте более тяжёлую модель для проектирования и отладки рабочего процесса — а затем закрепите процедуру как навык, чтобы середняк или спринтер могли выполнять её ежедневно за малую часть стоимости.
Однако есть скрытая стоимость, за которой нужно следить. Более дешёвая модель с низким счётом не является дешёвой, если каждый результат требует исправления — время на проверку человеком и стоимость ошибки являются частью реальной цены. Назовём это налогом на проверку. Он устанавливает нижнюю границу того, насколько лёгкой может быть модель. Что отличает Hyperagent, так это то, что проверка не просто оплачивается, но и накапливается: по мере того, как агент учится на ваших исправлениях через память, эти усилия по проверке сохраняются системой и приводят к лучшему агенту при следующем запуске.
Клиенты уже комплектуют агентов таким образом. Анкит Дас построил маркетинговую операцию с Growth Orchestrator на Sonnet 5, принимающим стратегические решения, и восемью специалистами по каналам на GLM 5.2, выполняющими регулярную работу по каналам, с отдельными QA-агентами, проверяющими соответствие бренду и качество текста — всё это запускается из одного треда. Эли Вайс описывает своё разделение проще: примерно 85% Sonnet и 15% Opus для своих навыков и рутин. Большая часть работы выполняется на ежедневном драйвере; Opus достаётся меньшему набору задач, где дополнительное обоснование оправдывает свою стоимость.
В этом и заключается практическая ценность выбора модели внутри Hyperagent. Тратьте осознанно на разные задачи и оставляйте дополнительные доллары для тех задач, где дополнительное обоснование меняет результат.
Выбирайте модель после того, как выбрали задачу
Используйте эту последовательность для агента, который у вас уже есть:
- Назовите задачу. «Подготовить еженедельный отчёт для клиента» полезнее, чем «помочь с отчётностью».
- Разместите её на карте. Решите, сколько суждений она требует и как часто будет выполняться.
- Начните там, куда указывает карта. Для большинства задач это способный середняк — используйте его, пока не поймёте пограничные случаи задачи и не закрепите процесс в виде навыков.
- Протестируйте на один класс легче в течение пяти реальных прогонов. Оставьте инструкции, навыки, память, источники и критерии оценки без изменений.
- Сравните полную стоимость. Отслеживайте качество готовой работы, стабильность, время, фактические ошибки, счёт за модель и время проверки человеком.
- Эскалируйте осознанно. Привлекайте тяжеловеса, когда бремя проверки или стоимость неверного ответа превышают премию за модель.
- Используйте другую модель для проверки важной работы. Модель, которая допустила ошибку, часто менее всего способна её заметить.
Оставьте самую дешёвую модель, которая стабильно соответствует вашим стандартам. Затем потратьте разницу на те задачи, которые её заслуживают.





