Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
(Ken Cen出品)Generative AI第24部 使用Pytorch編寫 Stable Diffusion 上部
Rating: 4.8 out of 5(4 ratings)
85 students

(Ken Cen出品)Generative AI第24部 使用Pytorch編寫 Stable Diffusion 上部

關於Stable Diffusion, U-NET,Forward Process, Reverse Process,latent,ELBO,Autoencoder,CLIP,VAE, Pytorch,Markov chain,
Created byKen Cen
Last updated 10/2025
Chinese (Traditional)
Chinese (Traditional) [Auto],

What you'll learn

  • 深入理解生成模型與概率分布的關係,以及擴散模型的正向(adding noise)與逆向(denoising)過程
  • 掌握 DDPM 論文(Denoising Diffusion Probabilistic Models)中正向與逆向過程的核心數學公式與變分推理方法
  • 學會訓練與採樣新數據的技巧,並能透過無分類器引導(classifier-free guidance)自訂生成結果的風格與品質
  • 熟悉 CLIP 模型在文本—圖像共同嵌入空間中的運作原理與應用場景
  • 掌握潛在擴散模型(Latent Diffusion Model)與變分自動編碼器(VAE)的結合應用,理解潛在空間中圖像生成的高效流程
  • 全面解析 Stable Diffusion 的編碼器(Encoder)與解碼器(Decoder)實現細節,以及整體架構設計

Course content

3 sections8 lectures4h 10m total length
  • 加入Udemy 全球最大的中文 AI 課程2:16
  • 課程工具準備2:41

    學員將準備課程工具

  • 如何使用uv 作為包管理器和項目管理工具10:53

    學員個將學會如何使用uv 作為包管理器和項目管理工具

Requirements

  • 一台電腦

Description

本課程從理論到實作,全方位解析 Stable Diffusion 及其背後的擴散模型(Diffusion Models),幫助學員掌握從基礎概念、數學原理到完整架構與編碼實現的整套流程,並具備在實際專案中進行微調與推論的能力。

  1. Stable Diffusion 概述

    • Stable Diffusion 是一款基於潛在擴散模型(Latent Diffusion Model)的深度學習文字生成影像框架,顛覆了 DALL·E 等專有模型的使用方式,開放源碼且可在常規 GPU 上運行 Wikipedia。

  2. 生成模型與概率分布

    • 介紹生成模型(Generative Models)如何學習複雜數據的概率分布,並以高斯分佈與變分推理作為實例說明 Wikipedia。

  3. 擴散模型的正向與逆向過程

    • 正向(forward)過程為逐步加入噪聲至數據;逆向(reverse)過程則學習將噪聲還原成數據的轉換,核心在於有限步數的馬可夫鏈建模 AI Summer。

  4. DDPM 論文的數學原理

    • 深入解讀 Jonathan Ho 等人提出的 Denoising Diffusion Probabilistic Models,包含變分下界(ELBO)分解與重構誤差項的推導 Wikipedia。

  5. 模型訓練方法

    • 實作如何設置噪聲日程(βₜ schedule)、選擇優化器與 loss 函數,並透過 PyTorch 範例演示完整訓練流程 Medium。

  6. 採樣生成新數據

    • 展示從隨機純噪聲到最終影像的迭代採樣(sampling)演算法,以及影響速度與品質的關鍵參數 Hugging Face。

  7. 控制去噪過程

    • 演示如何透過無分類器引導(classifier-free guidance)或自定義時間嵌入(time embeddings)調節生成內容的細節與風格 Hugging Face。

  8. 無分類器引導 (Classifier-Free Guidance)

    • 理解 “guidance scale” 如何在不依賴外部分類器的情況下提升生成品質,並提供範例程式碼示範。

  9. CLIP 模型

    • CLIP(Contrastive Language–Image Pretraining)通過對比學習將文本與圖像映射到同一向量空間,借助 4 億對圖文數據學習通用視覺語義表示 Wikipedia。

  10. 潛在擴散模型與 VAE

    • 講解 VAE(Variational Autoencoder)如何將高維圖像壓縮到低維潛在空間,再利用擴散模型在潛在空間中進行逐步噪聲與去噪 Wikipedia。

  11. Stable Diffusion 架構

    • 全面剖析架構:CLIP 文本編碼器、VAE 編碼器/解碼器、U-Net 去噪網絡,以及整合管線 超堆疊。

  12. 編碼器實現

    • 實作 VAE 編碼器將圖像映射到潛在表示的細節,包括卷積層設計與參數初始化。

  13. 解碼器實現

    • 演示如何根據潛在向量利用 U-Net 架構及注意力機制(self-attention)逐步還原高解析度影像。

Who this course is for:

  • AI/ML 研究者與工程師
  • 產品經理與創意設計師
  • 數據科學家與視覺工程師
  • 所有對 AI 藝術與創新應用有興趣者