我們如何訓練 AI 模型

@leerob
英語2 天前 · 2026年7月24日
174K
1.9K
192
69
2.6K

TL;DR

Lee Robinson 以人類學習的角度解釋 AI 模型訓練,詳細說明預訓練 (pretraining)、監督式微調 (supervised fine-tuning) 以及強化學習 (reinforcement learning) 如何塑造模型的智慧與行為。

AI 模型如何學習新技能和行為?

這個過程出奇地人性化且容易理解,即使你沒有機器學習背景也能掌握。

可靠的同事

AI 模型(越來越多經由 Agent 使用)就像一位可靠的同事。你曾共事過最優秀的人有哪些共同特質?

也許你會想到溝通能力極佳的同事,或是具備判斷力、知道何時該求助、何時該自己解決問題的人。還有一些更人性化的特質,像是親和力、同理心和善良。但我特別喜歡和那些能處理模糊問題並找到解決方法的人一起工作。

那麼,我們要如何讓模型表現得像那位理想同事呢?我們首先需要寫下自己對「正確」行為的定義。這份文件通常被稱為模型規範原則憲章或類似名稱。它既用於內部對齊,也作為訓練期間測試模型行為(即評估)的指導方針。

我們如何在工作上進步?

我過度簡化的說法是:嘗試困難的事、失敗、學習、然後透過重複來進步。

如果你正在帶領一位新同事入職,你不會期望他第一天就能產出。他需要學習如何使用你們的系統和工具,以及團隊如何協作。人類雖然不完美,但很擅長學習新技能(並記住它們)。

假設你想成為世界上最好的籃球員。你該用哪種方法來提升技能?

  1. 閱讀所有關於籃球比賽的文字資料。我們先忽略一天只有 24 小時的限制。
  2. 打一萬場籃球比賽。同樣忽略時間限制。你透過嘗試與錯誤、檢討比賽影片、評估自己的決策以及在練習中改進來學習。

知識和經驗是兩種不同的屬性,理想上你會想把兩者都練到滿。這讓我想到人們常說的「書本智慧」與「街頭智慧」。最優秀的球員兩者兼備。

要如何學得更快?找一位教練!理想的教練會觀察你打球,告訴你該修正什麼,並不斷把你推向當前的極限。他們會教你在獨自面對時做出高品質的決策,隨著時間推移,逐步調整你的「大腦權重」,讓你做出更好的判斷。

模型如何學習?

模型的學習方式與人類不盡相同,但人類的學習過程能提供有用的類比。

這些模型一開始透過從龐大的他人經驗庫(即預訓練)中學習預測模式。它們實際上可以讀完所有關於籃球的書!

預訓練之後,你會得到一個基礎模型。這個模型可能非常「博學」(例如它知道所有關於古代歷史的知識),但它並不完美,而且有些怪癖。跟它對話感覺不太好,而且它會犯錯。

接著,你向模型展示許多你想要它模仿的優秀行為範例(即監督式微調,簡稱 SFT)。可以把這想像成研究優秀球員的比賽影片。這能讓模型進步很多,但光靠模仿別人的動作是無法變得出色的。

你需要觀察模型執行真實任務,才能幫助它學習和改進。為了塑造它的行為,你讓模型進行模擬比賽,並在它表現良好時給予獎勵(即強化學習,簡稱 RL)。這個獎勵就像教練的回饋,你告訴模型它所做的決策是好是壞,透過更多嘗試來推動它進步。

最新研究也指出,像「誠實」這類更具通用性的特質可以在強化學習階段被學到。如果你教導模型在某個領域回答問題時更誠實,那麼誠實這項價值就會類推到回答任何問題時。

為模型評分

我們透過兩種主要方式來衡量模型是否進步:練習測驗(他們可以複習答案)和期末考(他們從未看過題目)。

舉例來說,人類若沒有測試理解程度,很難知道自己微積分是否進步了。如果你參加測驗後不及格,你就會確切知道自己哪裡需要加強,但這只有在被測驗的領域(例如數學)有解答的情況下才有效。

訓練大型 AI 模型的主要挑戰之一,就是創造多樣化的「測驗」。這些測驗的範圍從數學到程式碼都有可能。如果你能建立解答,那麼模型就可以反覆嘗試測驗並學習改進。

那麼,如何衡量模型在許多不同任務上的智慧呢?想想 AP 考試,它涵蓋從微積分到歷史等科目。許多這類考試結合了依正確性計分的選擇題,以及根據評分標準給分的自由作答題。

這與我們使用基準測試評估模型的方式類似。有些基準測試會衡量客觀可驗證的事項(例如測試是否通過?),而有些則要求另一個模型使用評分標準來評估結果(即 LLM 作為評審)。這些結果能提供參考,幫助你了解模型在訓練過程中是否真的在學習和進步。

關鍵在於,基準測試的用意是測試未見過或「保留」的任務。否則就有點像背下所有考試答案,然後去考場憑記憶寫出來,這並非真正的智慧衡量。

光有智慧還不夠

如果你是天才,但粗魯且缺乏社交意識,那麼人們很可能不會喜歡你。

我們大概都能想到身邊有這樣的人。光聰明是不夠的!因此,讓模型根據我們定義的「模型規範」表現出「正確」行為,是極其重要的事。

想像一下,你有個朋友每次結束對話時都會丟出一些流行化的 LLM 廢話,像是「老實說?這就是關鍵。」你很快就會不想跟他說話了。

訓練模型的工程師和研究人員在模型完成前,會花很多時間與新模型對話。他們會記錄所有怪癖和可以改進的地方。這可能包括過度使用「重點是:」這類套話,或是為了讓項目符號更簡短而犧牲清晰度,導致出現一些奇怪難懂、用詞過度複雜的語言。

找出問題後,他們就可以進一步訓練模型,懲罰不良行為,逐步引導模型表現出更符合規範的行為。此外,他們可以在生產環境中對模型進行 A/B 測試,並衡量使用者是否更偏好新版本的回應,以及是否獲得更好的結果。

持續學習

你可能會認為這些模型會隨著時間進步、變得更聰明。

但目前的運作方式並非如此!學習只發生在模型訓練期間。你的對話並不會即時更新模型的智慧。

相反地,你需要把要記住的事情寫下來,通常以規則或技能的形式儲存。Agent 可以讀取這些檔案,並在 prompting 模型時將其納入上下文。

這種透過檔案來記憶的簡陋方法出乎意料地有效,但要讓 Agent 能像新同事那樣學習和記住技能,還有更多工作要做。

教導模型成為有用的助手是一個深奧的主題。希望這篇高層次的概述能引起你的興趣,讓你進一步探索。如果你想看更多類似的解說,或希望我深入探討其他部分,請讓我知道!

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章