
學員將準備課程需要的軟體工具
學員將學會如何使用uv 作為包管理器和項目管理工具
學員將學會如何構建Reward Model 獎勵模型
學員將學會如何計算軌跡(Trajectories)及其在RL中的作用
學員將學會什麼是強化學習(Reinforcement Learning, RL)演算法 & 什麼是策略梯度優化
學員將學會什麼是 Advantage function 優勢函數& Q function Q 函數 & Value function 價值函數
學員將學會什麼是 Off-Policy Learning 離線策略學習 和 Importance Sampling 重要性採樣
在本課程中,我們將深入學習一系列強化學習(Reinforcement Learning, RL)中至關重要的核心概念與技術。理解以下主題的原因不僅是為了能夠實作一個完整的 RLHF(Reinforcement Learning with Human Feedback)系統,更是為了從根本上理解語言模型在實際應用中如何被微調與優化,以符合人類偏好。
課程內容:
如何構建 Reward Model(獎勵模型)
在傳統監督式學習中,我們依賴標註資料來告訴模型什麼是對的;但在 RLHF 中,我們使用獎勵模型來評估模型行為的好壞
如何計算 Trajectories(軌跡)及其在 RL 中的作用
在 RL 中,模型與環境互動後會產生一連串狀態、動作、獎勵的序列,這稱為一條軌跡(trajectory)
這些軌跡是我們計算期望報酬、策略更新、模型訓練的依據
什麼是強化學習(RL)演算法 & 策略梯度優化
強化學習讓模型可以透過與環境互動逐步學習「好的策略」
策略梯度(Policy Gradient)是一種重要方法,能夠直接對模型輸出機率進行優化,使其更可能產生高獎勵的行為
什麼是 Advantage Function、Q Function 和 Value Function
Value function 評估某個狀態的「長期價值」。
Q function 評估某個狀態下,採取某個動作的價值
Advantage function 則比較某動作相對於平均策略的好壞,是降低估計方差的關鍵
什麼是 Off-Policy Learning & Importance Sampling
Off-policy learning 讓我們可以使用「非當前策略」產生的軌跡來訓練模型,提高數據利用率
Importance sampling 則是數學工具,讓我們能夠糾正這種策略不一致所產生的偏差