Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
(Ken Cen出品)Generative AI第27部 強化學習模型RLHF 與 策略梯度優化
Rating: 5.0 out of 5(3 ratings)
85 students

(Ken Cen出品)Generative AI第27部 強化學習模型RLHF 與 策略梯度優化

關於 Reward Model 獎勵模型,Trajectory 軌跡,Q function Q 函數, Value function 價值函數, Advantage function 優勢函數, Offline Policy 離線策略
Created byKen Cen
Last updated 10/2025
Chinese (Traditional)
Chinese (Traditional) [Auto],

What you'll learn

  • 深入解析強化學習(Reinforcement Learning, RL)算法
  • 深入解析如何構建獎勵模型
  • 深入解析計算軌跡(Trajectories)及其在RL中的作用
  • 深入解析Off-Policy Learning 離線策略學習 和 Importance Sampling 重要性採樣

Course content

6 sections8 lectures5h 3m total length
  • 加入Udemy 全球最大的中文 AI 課程2:16
  • 課程工具準備2:41

    學員將準備課程需要的軟體工具

  • 如何使用uv 作為包管理器和項目管理工具10:53

    學員將學會如何使用uv 作為包管理器和項目管理工具

Requirements

  • 一台電腦

Description

在本課程中,我們將深入學習一系列強化學習(Reinforcement Learning, RL)中至關重要的核心概念與技術。理解以下主題的原因不僅是為了能夠實作一個完整的 RLHF(Reinforcement Learning with Human Feedback)系統,更是為了從根本上理解語言模型在實際應用中如何被微調與優化,以符合人類偏好。

課程內容:

如何構建 Reward Model(獎勵模型)

        在傳統監督式學習中,我們依賴標註資料來告訴模型什麼是對的;但在 RLHF 中,我們使用獎勵模型來評估模型行為的好壞


如何計算 Trajectories(軌跡)及其在 RL 中的作用

       在 RL 中,模型與環境互動後會產生一連串狀態、動作、獎勵的序列,這稱為一條軌跡(trajectory)

       這些軌跡是我們計算期望報酬、策略更新、模型訓練的依據


什麼是強化學習(RL)演算法 & 策略梯度優化

        強化學習讓模型可以透過與環境互動逐步學習「好的策略」

        策略梯度(Policy Gradient)是一種重要方法,能夠直接對模型輸出機率進行優化,使其更可能產生高獎勵的行為


什麼是 Advantage Function、Q Function 和 Value Function

        Value function 評估某個狀態的「長期價值」。

        Q function 評估某個狀態下,採取某個動作的價值

        Advantage function 則比較某動作相對於平均策略的好壞,是降低估計方差的關鍵


什麼是 Off-Policy Learning & Importance Sampling

        Off-policy learning 讓我們可以使用「非當前策略」產生的軌跡來訓練模型,提高數據利用率

        Importance sampling 則是數學工具,讓我們能夠糾正這種策略不一致所產生的偏差

Who this course is for:

  • 自然語言處理工程師與研究員
  • 強化學習愛好者與開發者
  • AI安全與對齊研究者
  • 具備基礎機器學習知識,想深入強化學習理論與實踐者