AI モデルはどのように新しいスキルや行動を学習するのか?
そのプロセスは驚くほど人間らしく、機械学習のバックグラウンドがなくても簡単に理解できます。
頼りになる同僚
エージェントを通じてますます活用される AI モデルは、頼りになる同僚のようなものです。あなたが一緒に働いた中で最も優秀な人たちには、どんな共通点がありましたか?
おそらく、コミュニケーションが上手な同僚や、助けを求めるべき時と自分で解決すべき時を見極める判断力を持った人を思い浮かべたのではないでしょうか。人柄が良く、共感力があり、親切といった、より人間的な資質もあります。しかし、私が特に一緒に働くのが好きなのは、曖昧な問題を受け止めて解決方法を見つけられる人です。
では、どうやってモデルを理想の同僚のように振る舞わせるのでしょうか?まずは、私たちの考える「正しい」行動を文章化する必要があります。この文書は モデル仕様書、行動規範、憲法 などと呼ばれ、社内のアライメントとトレーニング中のモデル動作テスト(評価)のガイドラインとして使用されます。
どうすれば仕事が上手くなるのか?
私の超単純化した説明は、難しいことに挑戦し、失敗し、学び、反復によって上達するというものです。
新しいチームメイトを迎えるとき、初日から戦力になるとは期待しませんよね。彼らは、あなたのシステムやツールの使い方、チームの連携の仕方を学ぶ必要があります。不完全な人間ですが、私たちは新しいスキルを学び(そして覚え続ける)のが非常に得意です。
例えば、あなたが世界最高のバスケットボール選手になりたいとしましょう。スキルを向上させるには、どのようなアプローチを取るべきでしょうか?
- バスケットボールに関するあらゆる文献を読む。1日24時間という制限は無視します。
- 10,000 試合のバスケットボールをプレイする。同じ時間改変ルールを適用します。試行錯誤、試合映像の確認、意思決定の採点、練習での改善を通じて学びます。
知識と経験は異なるステータスであり、理想的には両方を最大限に高めたいものです。これは、「本の知識」と「実地の知恵」の違いについて人々が話すのを思い出させます。最高のプレイヤーは両方を備えています。
どうすればより早く学べるでしょうか?コーチをつけることです!理想的なコーチは、あなたのプレイを見て、何を修正すべきかを教え、常に現在の限界に挑戦させてくれます。一人でいるときに質の高い判断ができるように教え、時間をかけてあなたの脳の重みをより良い判断へと導いてくれます。
モデルはどのように学習するのか?
モデルは人間とまったく同じようには学習しませんが、人間の学習は有益なアナロジーを提供します。
これらのモデルは、膨大な他人の経験のライブラリからパターンを予測することを学習することから始まります(事前学習)。実際、彼らはバスケットボールに関するあらゆる本を 読む ことができるのです!
事前学習後、ベースモデルが得られます。モデルは非常に「本の知識」に長けているかもしれませんが(例えば、古代史についてすべて知っている)、不完全で癖があります。話していて気持ちよくなく、間違いを犯すこともあります。
次に、モデルに模倣してほしい優れた行動の例をたくさん見せます(教師ありファインチューニング、SFT)。これは、偉大な選手の試合映像を研究するようなものだと考えてください。これでかなり上達しますが、他人の動きを真似するだけでは偉大にはなれません。
モデルが実際の作業を行うのを見て、学習と改善を助ける必要があります。モデルの行動を形成するために、シミュレーションゲームをプレイさせ、うまくいったら報酬を与えます(強化学習、RL)。この報酬はコーチのフィードバックのようなもので、モデルが下した判断が良かったか悪かったかを伝え、より多くの試行を通じて改善するよう促します。
新しい研究 は、誠実さのようなより汎化可能な性質も、RL 中に学習できることを示唆しています。ある領域の質問に答える際にモデルに正直になるよう教えると、誠実さのような価値観は あらゆる 質問に答える際に汎化されます。
モデルの評価
モデルが改善しているかどうかを測定する主な方法は、答えを確認できる模擬試験と、一度も見たことのない問題が出る本試験の 2 つです。
例えば、人間が微積分で上達しているかどうかを、理解度テストなしで知るのは難しいでしょう。テストを受けて不合格になれば、どこを改善すべきか正確にわかりますが、これはテスト対象の領域(例:数学)に解答がある場合にのみ機能します。
大規模な AI モデルをトレーニングする際の主な課題の 1 つは、多様な「テスト」を作成することです。これらのテストは、数学からコーディングまで、あらゆるものを対象にできます。解答を作成できれば、モデルはテストを何度も試して改善する方法を学べます。
さまざまなタスクにわたる知能を測定するにはどうすればよいでしょうか?微積分から歴史までをカバーする AP 試験を考えてみてください。これらの試験の多くは、正誤で採点される多肢選択問題と、ルーブリックに基づいて採点される自由記述問題を組み合わせています。
これは、ベンチマークでモデルを評価する方法と似ています。一部のベンチマークは客観的に検証可能なもの(例:テストは合格したか?)を測定し、他のベンチマークは別のモデルにルーブリックを使用して結果を採点させます(LLM-as-judge)。これらの結果は、トレーニング中にモデルが実際に学習し改善しているかどうかを理解するための参考情報を提供します。
重要なのは、ベンチマークは未見の、または「保留された」タスクをテストすることを目的としていることです。そうでなければ、テストの答えをすべて暗記して、記憶から書き写すようなものであり、真の知能の測定にはなりません。
知能だけでは不十分
天才でも、無礼で社会的に無自覚なら、おそらく人に好かれないでしょう。
私たちは皆、そういう知人を思い浮かべることができるでしょう。賢いだけでは十分ではないのです!だからこそ、モデルを(定義したモデル仕様に従って)「正しく」行動するようにアライメントすることが非常に重要です。
まるで、すべての会話を「正直なところ?それがポイントだ」といった、最近流行りの LLM の決まり文句で終わらせる友人がいると想像してください。すぐに話すのが嫌になるでしょう。
モデルをトレーニングするエンジニアや研究者は、完成前の新しいモデルと多くの時間をかけて対話します。彼らは、すべての癖や改善点を文書化します。例えば、「つまり」のような決まり文句の多用や、簡潔さを優先して明確さを犠牲にし、不自然で理解しにくい過度に複雑な言葉遣いになることなどです。
問題を特定したら、モデルをさらにトレーニングし、悪い行動にペナルティを与え、徐々にアライメントされた行動を持つモデルへと導きます。さらに、本番環境でモデルを A/B テストし、ユーザーが新しいバージョンの応答を好み、より良い結果を得たかどうかを測定できます。
継続的学習
これらのモデルは時間の経過とともに改善され、賢くなると期待するかもしれません。
しかし、現在の仕組みはそうではありません!学習はモデルがトレーニング中にのみ行われます。あなたの会話によってモデルの知能がリアルタイムで更新されるわけではないのです。
代わりに、覚えておくべきことを、通常はルールやスキルとしてファイルに書き留める必要があります。エージェントはこれらのファイルを読み取り、モデルにプロンプトを送信する際にコンテキストに含めることができます。
ファイルによるこの素朴な記憶アプローチは驚くほど効果的ですが、エージェントが新しい同僚のようにスキルを学習して記憶できるようになるまでには、さらに取り組むべきことがあります。
モデルを役立つように教えることは、深いテーマです。このハイレベルな概要が、さらに学びたいと思わせるほど興味深いものであれば幸いです。このような説明をもっと見たい場合や、別の部分をより深く掘り下げてほしい場合は、ぜひお知らせください!





