
學員將準備課程工具
學員個將學會如何使用uv 作為包管理器和項目管理工具
學員將學會什麼是Stable Diffusion & Forward Reverse Process & VAE & CLIP & U-NET & ELBO
學員將學會如何使用 Pytorch 編寫 VAE Encoder 編碼器
學員將學會如何用 Pytorch 編寫 VAE Decoder 解碼器
學員將學會如何編寫自注意力和交叉注意力機制代碼
學員將學會如何用 Pytorch 編寫 CLIP 文本編碼器
本課程從理論到實作,全方位解析 Stable Diffusion 及其背後的擴散模型(Diffusion Models),幫助學員掌握從基礎概念、數學原理到完整架構與編碼實現的整套流程,並具備在實際專案中進行微調與推論的能力。
Stable Diffusion 概述
Stable Diffusion 是一款基於潛在擴散模型(Latent Diffusion Model)的深度學習文字生成影像框架,顛覆了 DALL·E 等專有模型的使用方式,開放源碼且可在常規 GPU 上運行 Wikipedia。
生成模型與概率分布
介紹生成模型(Generative Models)如何學習複雜數據的概率分布,並以高斯分佈與變分推理作為實例說明 Wikipedia。
擴散模型的正向與逆向過程
正向(forward)過程為逐步加入噪聲至數據;逆向(reverse)過程則學習將噪聲還原成數據的轉換,核心在於有限步數的馬可夫鏈建模 AI Summer。
DDPM 論文的數學原理
深入解讀 Jonathan Ho 等人提出的 Denoising Diffusion Probabilistic Models,包含變分下界(ELBO)分解與重構誤差項的推導 Wikipedia。
模型訓練方法
實作如何設置噪聲日程(βₜ schedule)、選擇優化器與 loss 函數,並透過 PyTorch 範例演示完整訓練流程 Medium。
採樣生成新數據
展示從隨機純噪聲到最終影像的迭代採樣(sampling)演算法,以及影響速度與品質的關鍵參數 Hugging Face。
控制去噪過程
演示如何透過無分類器引導(classifier-free guidance)或自定義時間嵌入(time embeddings)調節生成內容的細節與風格 Hugging Face。
無分類器引導 (Classifier-Free Guidance)
理解 “guidance scale” 如何在不依賴外部分類器的情況下提升生成品質,並提供範例程式碼示範。
CLIP 模型
CLIP(Contrastive Language–Image Pretraining)通過對比學習將文本與圖像映射到同一向量空間,借助 4 億對圖文數據學習通用視覺語義表示 Wikipedia。
潛在擴散模型與 VAE
講解 VAE(Variational Autoencoder)如何將高維圖像壓縮到低維潛在空間,再利用擴散模型在潛在空間中進行逐步噪聲與去噪 Wikipedia。
Stable Diffusion 架構
全面剖析架構:CLIP 文本編碼器、VAE 編碼器/解碼器、U-Net 去噪網絡,以及整合管線 超堆疊。
編碼器實現
實作 VAE 編碼器將圖像映射到潛在表示的細節,包括卷積層設計與參數初始化。
解碼器實現
演示如何根據潛在向量利用 U-Net 架構及注意力機制(self-attention)逐步還原高解析度影像。