ある仕事に最適なモデルは、リーダーボードで最高のモデルであることはほぼありません。
AI の世界では、クリスマスは週に一度くらいの頻度でやってきます。新しいモデルが登場するたびに、誰もが同じ不正確なベンチマークのチャートを見つめ、それが最高のものだと合意します。そして翌週、また同じことを繰り返します。
しかし、これらのチャートはどれも、唯一重要な質問に答えていません。そのモデルは、実際にあなたの日次ブリーフィングを実行したり、顧客に見積もりを送信したりできるのでしょうか?Hyperagent では、最高クラスのエージェントとともに、これらすべてのモデルへのアクセスを提供しています。そこで、私たち自身でテストを実行しました。14 のモデル、42 回の実行を、顧客が毎日エージェントに任せている実際のナレッジワークで行いました。その結果、3 つの点が明らかになりました。
- 同一の作業で、請求額は最大 50 倍の差がありました。 同じテストバッテリーで、Qwen 3.7 Plus では 1.48 ドル、Fable 5 では 75.16 ドルでした。
- ベンチマークの勝者は、実務の勝者ではありませんでした。 GPT 5.6 Sol はベースラインテストでトップでしたが、Hyperagent 内で実際のジョブを実行したところ、トップ 3 に入ることは一度もありませんでした。Grok 4.5 はベースラインでは中程度でしたが、完了した作業、速度、コストでトップになりました。
- そして、すべてを制したモデルはありませんでした。 適切な選択は、ジョブによって変わりました。
ここから得られる教訓は、新しいお気に入りのモデルを見つけることではありません。それは、ジョブごとに、どのモデルがコストに見合うかを判断する方法です。
ナレッジワークのための AI モデルマップ
エージェントに任せるすべてのジョブは、2 つの質問に帰着します。どれだけの判断力が必要か、そして、どれだけの頻度で実行されるか?この 2 つの軸をプロットすると、ナレッジワークは 4 つの領域に分類され、それぞれに異なる種類のモデルが必要です。

ボリュームワーク(左上)。トリアージ、監視、ルーティング、データ同期。明確な手順があり、常時実行され、ミスは簡単に修正できます。この作業には、高速で低コストなものが求められます。
日常的なクラフト(右上)。ドラフト作成、レポート作成、リサーチ、クライアントとのコミュニケーション。週の大半を占める反復的なナレッジワークです。実際の合成と優れたライティングスタイルが必要であり、信頼性が高く頻繁に実行されます。
ハイステークス(右下)。契約レビュー、価格決定の判断、深掘り分析。頻度は低いですが、間違った回答はクライアント、契約、四半期の利益を失う可能性があります。ここでは、下落リスクがモデル料金をはるかに上回り、最も高価なモデルがその価値を発揮します。
最適化不要(左下)。たまに発生する単純な依頼で、適切なモデルならどれでも基準をクリアし、価格差も小さく、わざわざ判断する必要がありません。これは、マップ上の 4 つの領域の中で、私たちが考える必要はないと伝えている唯一の領域です。
3 つのモデルクラス
マップから、3 つの実用的なクラスが浮かび上がります。これらは、モデルを良いか悪いかで評価するのではなく、ジョブの経済性と判断力のプロファイルを説明します。
スプリンター は、ボリュームワーク向けに構築されています。手順が明確でミスが簡単に修正できる場合に、高速、低コスト、一貫性を発揮します。Haiku 4.5、Gemini 3.5 Flash、DeepSeek V4 Pro が該当します。
ミドルウェイト は、日常的なクラフトを実行します。情報源を統合し、マルチステップの計画を保持し、優れた文章を作成しますが、すべてのレポートにトップクラスの料金を請求することはありません。Sonnet 5、GPT 5.6 Terra、Grok 4.5、GLM 5.2 が該当し、ほとんどのナレッジワークはここに属します。
ヘビーウェイト は、ハイステークスの判断を担います。より強力な判断力とより多くの推論時間を、間違った回答がモデル料金よりもはるかに高くつく作業に投入します。Opus 4.8、GPT 5.6 Sol、Fable 5 が該当します。
多くの人が持つ本能は、高いレベルから始めて下げていくことです。すべてを Fable 5 や Opus 4.8 で実行し、望む出力を得てから、品質が低下するまでより安価なモデルを試すというものです。これは機能しますが、ほとんどのジョブでは必要ないことがわかりました。ジョブを特定し、マップ上に配置できれば、通常は最初から適切なクラスから始めることができます。日常的なクラフト(ほとんどの作業がこれに該当します)の場合、それは Sonnet 5 のような堅実なミドルウェイトから始めることを意味します。ジョブが本当にハイステークスに該当する場合にのみ、トップダウン検索を利用します。
選択肢は Claude、GPT、Gemini だけではない
ほとんどのチームは、既に知っているいくつかのモデル名をデフォルトで使用します。これは合理的な出発点ですが、多くのモデルが使われないままになっています。Hyperagent で最も有用な作業を行っているモデルの中には、広く知られていないものもあります。以下は、テストバッテリーと日常的な使用、そして顧客が実行している作業から得た私たちの運用上の印象です。
Grok 4.5 は、高速でリアルタイムのリサーチに優れています。ツールを多用するリサーチを迅速に処理し、Hyperagent のネイティブ Exa Search と組み合わせると特に優れたパフォーマンスを発揮しました。また、X へのネイティブラインを持っているため、リアルタイムのセンチメントに関する質問に対して、回答の背後にある実際の投稿を返すことができます。フル実行の完了スコアでトップとなり、コストは 9.71 ドルでした。
Muse Spark 1.1 は、クリーンな文章を作成し、自己チェックを行います。ハーネスでのテストでは 2 位になりました。初期の評価では、簡潔で構造化された散文を生成し、作業を返す前に自分の作業を監査するという有用な習慣があります。まだ新しいモデルなので、長期の無人ジョブよりも先に、監視下での日常的なジョブから使い始めることをお勧めします。
Kimi K2.6 は、オープンモデルの価格で深層リサーチを提供します。検索を並行して実行し、フラッグシップモデルの料金を請求することなく、証拠を単一の回答にまとめ上げるため、強力なリサーチスペシャリストです。唯一の制限はドキュメントサイズで、コンテキストウィンドウは最大 256,000 トークンです。
GLM 5.2 は、コストパフォーマンスに優れた選択肢です。日常的なリサーチ、ドラフト作成、長文ドキュメント処理において、クローズドなミドルウェイトに驚くほど近いパフォーマンスを、約 3 分の 1 の価格で発揮します。その散文は、Sonnet や Opus 以外では最も優れたものの一つです。Hyperagent チームの多くのメンバーにとって、日常的に使用するモデルとなっています。
Qwen 3.7 Plus は、画面操作に優れています。レンダリングされたページ上のボタン、フィールド、メニューを見つけるのが特に得意で、構造化抽出には低コストです。テストバッテリーの中で最も低コストで完全な実行を実現しました。文章のスタイルよりも、インターフェースの操作やデータの移動が重要なジョブに適しています。
DeepSeek V4 Pro は、非常に低コストで構造化分析を提供します。照合、データクレンジング、定期的な数値処理、および同様の構造化タスクで最も強みを発揮します。文章は文字通りで簡潔であり、内部説明には適していますが、クライアント向けの散文には適していません。スペシャリストであり、非常に経済的です。
常時稼働のエージェントを適切な価格で配置する
Steve Juba は、6 人の旅行会社を経営しています。彼は、8 つのライブデータソースに接続されたブリーフィングエージェントを構築し、1 日に数回実行しています。これにより、朝の情報収集時間が、8 つのタブをまたいで 3 時間以上かかっていたのが、15 分に短縮されました。
このようなエージェントは、書く量よりも読む量がはるかに多く、同じジョブを年間何百回も実行するため、実行あたりの小さな価格差は、切り捨て誤差ではなく、実際の予算項目になります。毎日 100,000 トークンを読み、2,000 トークンを書くブリーフィングを考えてみましょう。2026 年 7 月のリスト価格では、この形状の作業はおおよそ以下のようになります。
- Qwen 3.7 Plus(スプリンター):年間約 16 ドル
- Kimi K2.6(ミドルウェイト):年間約 38 ドル
- Haiku 4.5(スプリンター):年間約 40 ドル
- Sonnet 5(ミドルウェイト):年間約 80 ドル

このような読み取り重視の作業では、オープンウェイトのオプションが計算を変えます。Kimi K2.6 は、このジョブで 38 ドルでミドルウェイト品質のリサーチと統合を提供します。これは Sonnet 5 の半分以下であり、スプリンターの Haiku を実行するのとほぼ同じコストです。判断力とコストをトレードオフしているのではなく、スプリンターの価格でミドルウェイトの作業を得ているのです。ジョブが判断力を必要としない純粋な抽出であれば、Qwen は 16 ドルで実行できます。しかし、実際の統合が必要になった瞬間に、Kimi はほぼ同じ価格でそれを提供します。
モデルを交換し、エージェントは維持する
モデルを切り替えるたびにエージェントを再構築する必要があるなら、これらはすべて無意味です。Hyperagent ではその必要はありません。なぜなら、モデルは単なる設定の一つであり、役割はその上に位置するからです。モデルを変更しても、エージェントはその有用性を構成するすべての要素を保持します。
- 指示とスコープ
- スキル、スクリプト、作業手順
- 修正履歴の記憶
- 参照ファイルと会社のコンテキスト
- 作業が存在するシステムへの接続
- 品質を評価するためのルーブリック

これにより、モデルの選択は移行ではなくテストになります。同じエージェントが、再構築することなく、2 つのモデルで同じジョブを実行できます。そのため、推測する代わりに、基準をクリアする最も安価なモデルを見つけることができます。
また、難しいワークフローの高価な部分を、一度だけ自己負担させることもできます。ジョブが本当にそれを必要とする場合、より重いモデルを使用してワークフローを設計およびデバッグし、その後、手順をスキルとしてコード化することで、ミドルウェイトやスプリンターが毎日、わずかなコストで実行できるようにします。
ただし、注意すべき隠れたコストがあります。請求額が低い安価なモデルは、すべての出力を修正する必要がある場合、安くはありません。人的なレビュー時間とミスのコストは、実際の価格の一部です。これをレビュー税と呼びましょう。これは、どれだけ軽量化できるかの下限を設定します。Hyperagent で異なるのは、レビューが単に支払われるだけでなく、複利的に効果を発揮する点です。エージェントが記憶を通じてあなたの修正から学習するにつれて、そのレビュー努力はハーネスによって捕捉され、次回の実行時により良いエージェントを生み出します。
顧客はすでにこの方法でエージェントを配置しています。Ankit Das は、Sonnet 5 で判断を下す Growth Orchestrator と、GLM 5.2 で定型的なチャンネル作業を生成する 8 つのチャンネルスペシャリスト、そしてブランドコンプライアンスとライティング品質をチェックする個別の QA エージェントで構成されるマーケティングオペレーションを構築し、すべてを単一のスレッドから起動しました。Eli Weiss はその分割をより単純に説明しています。彼のスキルとルーティン全体で、約 85% が Sonnet、15% が Opus です。ほとんどの作業は日常的に使用するモデルで実行され、Opus は、追加の判断力がコストに見合う、より少数のジョブに使用されます。
これが、Hyperagent 内でのモデル選択の実用的な価値です。作業全体に意図的に支出し、追加の判断力が結果を変えるジョブのために、余分なドルを確保してください。
ジョブを選んでから、モデルを選ぶ
既に実行しているエージェントに対して、以下の順序を使用してください。
- ジョブを特定する。 「月曜日のクライアントレポートを準備する」は、「レポート作成を手伝う」よりも有用です。
- マップ上に配置する。 どれだけの判断力が必要か、どれだけの頻度で実行されるかを決定します。
- マップが示す場所から始める。 ほとんどの作業では、それは有能なミドルウェイトです。ジョブのエッジケースを理解し、プロセスをスキルにコード化するまで、それを使用します。
- 1 つ軽いクラスを、実際の 5 回の実行でテストする。 指示、スキル、記憶、情報源、ルーブリックは変更しないでください。
- 総コストを比較する。 完了した品質、一貫性、時間、事実の見落とし、モデル料金、人的なレビュー時間を追跡します。
- 意図的に上位モデルにエスカレートする。 レビュー負担や誤った回答のコストがモデルのプレミアムを上回る場合に、ヘビーウェイトを導入します。
- 重要な作業のレビューには別のモデルを使用する。 間違いを犯したモデルは、その間違いを見つける可能性が最も低いことがよくあります。
基準を確実にクリアする最も低コストなモデルを維持してください。そして、その差額を、それに見合う判断を必要とする場面に充ててください。





