Quels modèles sont vraiment rentables ? Nous avons testé 14 modèles sur des tâches réelles pour le découvrir.

@andrewbusse
ANGLAISil y a 2 jours · 23 juil. 2026
166K
11
3
1
8

TL;DR

Cette analyse de 14 modèles d'IA révèle que les leaders des benchmarks échouent souvent dans le travail intellectuel réel. Elle propose un cadre pour choisir les modèles en fonction du jugement et de la fréquence, en les classant en sprinteurs, poids moyens et poids lourds.

Le meilleur modèle pour un travail n'est presque jamais le meilleur modèle du classement.

Dans le monde de l'IA, Noël tombe environ une fois par semaine. Un nouveau modèle sort, tout le monde scrute les mêmes benchmarks à la précision trompeuse, et on s'accorde à dire que c'est la meilleure invention depuis le pain tranché, jusqu'à la semaine suivante, où on recommence.

Mais aucun de ces graphiques ne répond à la seule question qui compte. Le modèle peut-il réellement exécuter votre briefing quotidien ou envoyer un devis à un client ? Chez Hyperagent, nous vous donnons accès à tous ces modèles sur un agent de premier ordre. Nous les avons donc testés nous-mêmes. Quatorze modèles, quarante-deux exécutions, sur le vrai travail de connaissance que nos clients confient à nos agents chaque jour. Trois constats.

  • La facture variait de 50 fois pour un travail identique. La même batterie de tests a coûté 1,48 $ sur Qwen 3.7 Plus et 75,16 $ sur Fable 5.
  • Le gagnant du benchmark n'était pas le gagnant du travail réel. GPT 5.6 Sol a dominé nos tests de base, mais n'est pas entré dans le top trois une fois qu'il exécutait de vrais travaux dans Hyperagent. Grok 4.5 était milieu de tableau sur les tests de base et s'est retrouvé premier en termes de travail finalisé, de rapidité et de coût.
  • Et aucun modèle n'a tout gagné. Le bon choix dépendait du travail.

La conclusion n'est pas un nouveau modèle favori. C'est une méthode pour décider, travail par travail, lequel mérite son coût.

La carte des modèles d'IA pour le travail de connaissance

Chaque tâche que vous confieriez à un agent se résume à deux questions : combien de jugement nécessite-t-elle, et à quelle fréquence est-elle exécutée ? Placez ces deux axes, et le travail de connaissance se divise en quatre territoires, chacun demandant un type de modèle différent.

Andrew Busse - inline image

Travail à volume (en haut à gauche). Triage, surveillance, routage, synchronisation de données. Procédure claire, exécution constante, et une erreur est peu coûteuse à corriger. Ce travail veut quelque chose de rapide et peu coûteux.

Le métier quotidien (en haut à droite). Rédaction, reporting, recherche, communications clients. Le travail de connaissance récurrent qui remplit la plus grande partie de la semaine – il nécessite une véritable synthèse et une bonne plume, de manière fiable et régulière.

Enjeux élevés (en bas à droite). Révision de contrats, décisions de tarification, analyses approfondies. Rare, mais une mauvaise réponse coûte un client, un contrat, ou une marge trimestrielle. C'est là où le risque dépasse largement la facture du modèle, et où les modèles les plus chers justifient leur tarif.

Ne pas optimiser (en bas à gauche). Les demandes simples et occasionnelles où tout modèle compétent fait l'affaire, et où l'écart de prix est trop faible pour mériter une décision. C'est la seule case de la carte où nous disons aux gens de ne pas réfléchir.

Les trois classes de modèles

Trois classes de travail émergent de la carte. Elles décrivent l'économie et le profil de jugement du travail, plutôt que de classer un modèle comme bon ou mauvais.

Les sprinteurs sont conçus pour le travail à volume – rapides, bon marché et cohérents lorsque la procédure est claire et qu'une erreur est facile à corriger. Haiku 4.5, Gemini 3.5 Flash et DeepSeek V4 Pro.

Les poids moyens gèrent le métier quotidien. Ils synthétisent des sources, tiennent un plan en plusieurs étapes, et rédigent bien sans facturer des tarifs de première classe pour chaque rapport. Sonnet 5, GPT 5.6 Terra, Grok 4.5 et GLM 5.2 – là où se situe la majeure partie du travail de connaissance.

Les poids lourds prennent les décisions à enjeux élevés, apportant un jugement plus solide et plus de temps de raisonnement à un travail où une mauvaise réponse coûte bien plus que la facture du modèle. Opus 4.8, GPT 5.6 Sol et Fable 5.

L'instinct de la plupart des gens est de commencer par le haut et de descendre – tout exécuter sur un Fable 5 ou un Opus 4.8, obtenir le résultat souhaité, puis essayer des modèles moins chers jusqu'à ce que la qualité baisse. Ça marche, mais nous avons constaté que la plupart des tâches n'en ont pas besoin. Une fois que vous pouvez nommer la tâche et la placer sur la carte, vous pouvez généralement commencer dans la bonne classe dès le départ. Pour le métier quotidien, qui constitue l'essentiel de ce que vous faites, cela signifie commencer sur un poids moyen solide comme Sonnet 5. Vous ne recourez à la recherche descendante que lorsqu'une tâche se situe véritablement à l'extrémité des enjeux élevés.

Le terrain est plus large que Claude, GPT et Gemini

La plupart des équipes se limitent aux quelques noms de modèles qu'elles connaissent déjà. C'est un point de départ raisonnable, mais cela laisse une grande partie de l'effectif inexploitée – et certains des modèles qui effectuent le travail le plus utile dans Hyperagent ne sont pas des noms familiers. Voici nos impressions opérationnelles issues de la batterie de tests et de l'utilisation quotidienne, ainsi que du travail que nous avons vu nos clients effectuer.

Grok 4.5 est la recherche rapide en temps réel. Il se déplace rapidement dans les travaux de recherche intensifs en outils et a particulièrement bien performé associé à la recherche native Exa d'Hyperagent. Il dispose également d'une connexion native à X, donc une question sur un sentiment en temps réel peut revenir avec les publications réelles derrière la réponse. Il a mené notre score de travail finalisé à 9,71 $ pour l'ensemble de l'exécution.

Muse Spark 1.1 écrit proprement et se vérifie lui-même. Il a terminé deuxième dans le harnais, et notre première impression est une prose concise et bien structurée avec une habitude utile d'auditer son propre travail avant de le rendre. Il est encore nouveau, donc nous recommanderions de commencer par des tâches quotidiennes supervisées avant les longues tâches non supervisées.

Kimi K2.6 est la recherche approfondie à un prix de modèle ouvert. Il effectue des recherches en parallèle et rassemble les preuves dans une seule réponse sans facturer des tarifs de vaisseau amiral, ce qui en fait un spécialiste de la recherche solide. Sa seule limite réelle est la taille des documents, avec une fenêtre de contexte qui plafonne à 256 000 tokens.

GLM 5.2 est le choix économique. Il s'est approché étonnamment près des poids moyens fermés en matière de recherche de routine, de rédaction et de travail sur de longs documents, pour environ un tiers du prix, et sa prose est parmi les plus solides en dehors de Sonnet et Opus. Il est devenu un outil quotidien pour une grande partie de l'équipe Hyperagent.

Qwen 3.7 Plus est le travailleur d'écran. Il est particulièrement doué pour trouver les boutons, les champs et les menus sur les pages rendues, et il est peu coûteux pour l'extraction structurée – il a produit l'exécution complète la moins chère de notre batterie. Utilisez-le lorsque le travail consiste à manipuler une interface ou à déplacer des données, pas lorsque la voix compte.

DeepSeek V4 Pro est l'analyse structurée à très faible coût. Il est le plus fort en matière de rapprochement, de nettoyage de données, de travail numérique planifié et de tâches structurées similaires. Son écriture est littérale et concise, ce qui sert bien les explications internes et mal la prose destinée aux clients. Un spécialiste, et très économique.

Équiper vos agents toujours actifs au bon prix

Steve Juba dirige une entreprise de voyage de six personnes. Il a construit un agent de briefing connecté à huit sources de données en direct qui s'exécute plusieurs fois par jour, et cela a réduit sa collecte de contexte matinale de plus de trois heures sur huit onglets à quinze minutes.

Un agent comme celui-ci lit bien plus qu'il n'écrit et effectue le même travail des centaines de fois par an, donc une petite différence de prix par exécution cesse d'être une erreur d'arrondi et devient une véritable ligne budgétaire. Considérez un briefing qui lit 100 000 tokens et en écrit 2 000 chaque jour. Aux prix catalogue de juillet 2026, cette forme de travail coûte environ :

  • 16 $ par an sur Qwen 3.7 Plus (sprinteur)
  • 38 $ par an sur Kimi K2.6 (poids moyen)
  • 40 $ par an sur Haiku 4.5 (sprinteur)
  • 80 $ par an sur Sonnet 5 (poids moyen)
Andrew Busse - inline image

Les options à poids ouvert changent la donne pour ce type de travail intensif en lecture. Kimi K2.6 fournit une recherche et une synthèse de qualité poids moyen pour 38 $ sur ce travail – moins de la moitié du prix de Sonnet 5, et à peu près le même prix que le sprinteur Haiku. Vous n'échangez pas du jugement contre du coût ; vous obtenez un travail de poids moyen pour le prix d'un sprinteur. Si le travail était une pure extraction sans jugement, Qwen le ferait pour 16 $ – mais dès qu'il nécessite une véritable synthèse, Kimi vous l'offre pour presque le même prix.

Échangez le modèle, gardez l'agent

Rien de tout cela n'a d'importance si changer de modèle signifie reconstruire l'agent. Dans Hyperagent, ce n'est pas le cas, car le modèle n'est qu'un paramètre et le rôle se situe au-dessus. Changez le modèle et l'agent conserve tout ce qui le rend utile :

  • Ses instructions et son périmètre
  • Ses compétences, scripts et procédures de travail
  • Sa mémoire des corrections
  • Ses fichiers de référence et le contexte de l'entreprise
  • Ses connexions aux systèmes où le travail réside
  • Ses grilles d'évaluation de la qualité
Andrew Busse - inline image

Cela transforme le choix du modèle en un test plutôt qu'en une migration. Le même agent peut exécuter le même travail sur deux modèles sans être reconstruit, vous pouvez donc trouver le moins cher qui atteint votre seuil de qualité sans avoir à deviner.

Cela permet également à la partie coûteuse d'un flux de travail difficile de s'autofinancer une fois. Lorsqu'un travail en a réellement besoin, utilisez un modèle plus lourd pour concevoir et déboguer le flux de travail – puis codifiez la procédure sous forme de compétence afin qu'un poids moyen ou un sprinteur puisse l'exécuter chaque jour à une fraction du coût.

Il y a cependant un coût caché à surveiller. Un modèle moins cher avec une facture basse n'est pas bon marché si chaque résultat nécessite une correction – le temps de révision humaine et le coût d'une erreur font partie du prix réel. Appelons-le la taxe de révision. Elle fixe le plancher de la légèreté possible. Ce qui est différent dans Hyperagent, c'est que la révision n'est pas seulement payée, elle se cumule : à mesure que l'agent apprend de vos corrections via la mémoire, cet effort de révision est capturé par le harnais et produit un meilleur agent à l'exécution suivante.

Les clients équipent déjà leurs agents de cette manière. Ankit Das a construit une opération marketing avec un orchestrateur de croissance sur Sonnet 5 prenant les décisions de jugement et huit spécialistes de chaîne sur GLM 5.2 produisant le travail récurrent de chaîne, avec des agents QA séparés vérifiant la conformité de la marque et la qualité rédactionnelle – le tout déclenché à partir d'un seul fil. Eli Weiss décrit sa répartition plus simplement : environ 85 % Sonnet et 15 % Opus dans ses compétences et routines. La plupart du travail tourne sur le moteur quotidien ; Opus reçoit l'ensemble plus restreint de tâches où le jugement supplémentaire justifie son coût.

C'est la valeur pratique du choix du modèle dans Hyperagent. Dépensez délibérément selon le travail, et réservez les dollars supplémentaires pour les tâches où un jugement supplémentaire change le résultat.

Choisissez le modèle après avoir choisi le travail

Utilisez cette séquence sur un agent que vous exécutez déjà :

  1. Nommez le travail. « Préparer le rapport client du lundi » est plus utile que « aider avec le reporting ».
  2. Placez-le sur la carte. Décidez du niveau de jugement nécessaire et de la fréquence d'exécution.
  3. Commencez là où la carte le place. Pour la plupart des travaux, c'est un poids moyen compétent – utilisez-le jusqu'à ce que vous compreniez les cas particuliers du travail et codifiez le processus en compétences.
  4. Testez une classe plus légère sur cinq exécutions réelles. Gardez les instructions, compétences, mémoire, sources et grille d'évaluation inchangées.
  5. Comparez le coût total. Suivez la qualité du travail finalisé, la cohérence, le temps, les erreurs factuelles, la facture du modèle et le temps de révision humaine.
  6. Remontez délibérément. Faites appel à un poids lourd lorsque la charge de révision ou le coût d'une mauvaise réponse dépasse la prime du modèle.
  7. Utilisez un modèle différent pour réviser les travaux importants. Le modèle qui a fait l'erreur est souvent le moins susceptible de la voir.

Gardez le modèle le moins cher qui atteint régulièrement votre niveau d'exigence. Puis dépensez la différence sur les décisions qui la méritent.

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux