Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化
Rating: 5.0 out of 5(1 rating)
86 students

(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化

關於KL懲罰,Frozen Model,Entropy,Advantage Function ,Value Function,Bradley-Terry 偏好模型
Created byKen Cen
Last updated 10/2025
Chinese (Traditional)
Chinese (Traditional) [Auto],

What you'll learn

  • 深入瞭解 PPO Policy Gradient & PPO Clipped Objective
  • 深入瞭解 Value Function Loss & Policy Entropy & Total PPO Loss PPO 總損失
  • 深入瞭解什麼是 DPO & 如何解決約束優化問題
  • 學會如何使用 Pytorch實現 SFT 監督微調
  • 學會如何使用 Pytorch實現 DPO 直接偏好優化 Direct Preference Optimization

Course content

3 sections8 lectures5h 17m total length
  • 加入Udemy 全球最大的中文 AI 課程2:16
  • 課程工具準備2:41

    學員將為課程安裝需要的軟體

  • 如何使用uv 作為包管理器和項目管理工具10:53

    學員將會學會如何使用uv 作為包管理器和項目管理工具

Requirements

  • 一臺電腦

Description

(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化


課程會在(Ken Cen出品)Generative AI第27部的基礎上,深入發掘 PPO 和 DPO 對修正 AI 行為背後的原理的 Pytorch 實際操作。


為什麼要學習 PPO 和 DPO?

隨著大模型快速發展,我們愈來愈關注一個核心問題:

模型的回答是否符合人類偏好?是否「對齊」人類的價值與需求?

本課程介紹的 PPO(Proximal Policy Optimization)DPO(Direct Preference Optimization) 是目前最主流的兩種對齊技術。掌握這些技術,你將能:

訓練出 對使用者更友善、更精確的 LLM

學會如何實作如 ChatGPT背後的策略調整機制

跟上大型 AI 公司對「對齊問題(Alignment)」的技術趨勢


課程內容重點介紹

PPO 對齊技術精解

  • PPO 損失函數組成與剪裁(Clipping)
    避免模型劇烈更新,提升穩定性。

  • Advantage Function & Value Function
    評估「採取行動比預期好多少」,是強化學習的核心。

  • Entropy(熵)獎勵:鼓勵探索、避免陷入局部最優
    熵越高 → 模型更願意嘗試新策略。

  • Frozen Model & KL懲罰:防止「作弊」學壞
    固定參考模型,並限制與其差異,防止模型偏離人類偏好。

DPO 對齊革命性新方法

  • 從獎勵模型到 Bradley-Terry 偏好模型
    從 pairwise 比較中學習人類偏好。

  • DPO 損失函數推導與數學解析解
    理論 + 工程實作,讓你掌握真正原理。

  • KL 散度約束與 Lagrange 乘子技術
    精準控制策略偏移與對齊速度。

PyTorch實戰:從理論到實作

你將學會如何用 PyTorch 完整實現:

  • PPO 訓練流程:包括策略梯度、值函數損失、熵項與總損失計算

  • DPO 訓練流程:用偏好資料直接優化策略,無需建立獎勵模型

  • SFT(Supervised Fine-Tuning)監督微調流程

  • 計算 Log Probability、KL 散度、Entropy 等關鍵指標

Who this course is for:

  • 對 AI 感興趣的學員
  • AI 高薪從業者