
學員將為課程安裝需要的軟體
學員將會學會如何使用uv 作為包管理器和項目管理工具
學員將學會什麼是 PPO Policy Gradient & PPO Clipped Objective & Value Function Loss & Policy Entropy & Total PPO Loss PPO 總損失
學員將學會如何使用 Pytorch 訓練 PPO 並計算對數機率 & KL 散度 & 策略熵
學員將學會什麼是 DPO & 如何解決約束優化問題
學員將學會如何使用 Pytorch實現 SFT 監督微調
學員將學會如何使用 Pytorch實現 DPO 直接偏好優化 Direct Preference Optimization
(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化
課程會在(Ken Cen出品)Generative AI第27部的基礎上,深入發掘 PPO 和 DPO 對修正 AI 行為背後的原理的 Pytorch 實際操作。
為什麼要學習 PPO 和 DPO?
隨著大模型快速發展,我們愈來愈關注一個核心問題:
模型的回答是否符合人類偏好?是否「對齊」人類的價值與需求?
本課程介紹的 PPO(Proximal Policy Optimization) 和 DPO(Direct Preference Optimization) 是目前最主流的兩種對齊技術。掌握這些技術,你將能:
訓練出 對使用者更友善、更精確的 LLM
學會如何實作如 ChatGPT背後的策略調整機制
跟上大型 AI 公司對「對齊問題(Alignment)」的技術趨勢
課程內容重點介紹
PPO 對齊技術精解
PPO 損失函數組成與剪裁(Clipping)
避免模型劇烈更新,提升穩定性。
Advantage Function & Value Function
評估「採取行動比預期好多少」,是強化學習的核心。
Entropy(熵)獎勵:鼓勵探索、避免陷入局部最優
熵越高 → 模型更願意嘗試新策略。
Frozen Model & KL懲罰:防止「作弊」學壞
固定參考模型,並限制與其差異,防止模型偏離人類偏好。
DPO 對齊革命性新方法
從獎勵模型到 Bradley-Terry 偏好模型
從 pairwise 比較中學習人類偏好。
DPO 損失函數推導與數學解析解
理論 + 工程實作,讓你掌握真正原理。
KL 散度約束與 Lagrange 乘子技術
精準控制策略偏移與對齊速度。
PyTorch實戰:從理論到實作
你將學會如何用 PyTorch 完整實現:
PPO 訓練流程:包括策略梯度、值函數損失、熵項與總損失計算
DPO 訓練流程:用偏好資料直接優化策略,無需建立獎勵模型
SFT(Supervised Fine-Tuning)監督微調流程
計算 Log Probability、KL 散度、Entropy 等關鍵指標