Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
(Ken Cen 出品) Generative AI 第 32 部:多模態融合:視覺+語言模型高效推論 (下)
Rating: 5.0 out of 5(3 ratings)
77 students

(Ken Cen 出品) Generative AI 第 32 部:多模態融合:視覺+語言模型高效推論 (下)

Multi Modal,RoPE,GQA,KVCache,MLP,RMS 歸一化
Created byKen Cen
Last updated 10/2025
Chinese (Traditional)
Chinese (Traditional) [Auto],

What you'll learn

  • 深入瞭解如何用Pytorch製作 RoPE 旋轉位置編碼
  • 深入瞭解如何用 Pytorch編寫 GQA 分組查詢注意力
  • 深入瞭解如何用 Pytorch 編寫 KVCache & RMS 歸一化 & MLP 多層感知器
  • 深入瞭解為什麼需要殘差連接 & 為什麼Gemma 要設定前置層歸一化 & 為什麼要乘以sqrt(hidden_size)
  • 深入瞭解如何使用Pytorch 實現 PaliGemma 推理過程

Course content

3 sections9 lectures7h 34m total length
  • 加入Udemy 全球最大的中文 AI 課程2:16
  • 課程工具準備2:41

    學員將為課程工具準備

  • 如何使用uv 作為包管理器和項目管理工具10:53

    學員將瞭解如何使用uv 作為包管理器和項目管理工具

Requirements

  • 一臺電腦

Description

本課程會繼續在Generative AI 第 31 部的視覺模型的基礎上,繼續多模態模型的架構的編寫。

深入瞭解多模態模型如何在一個投影層上合併文字嵌入和圖像嵌入。

而多模態模型要同時處理文字+图像信息時會有明顯的差異。

而 PaliGemma 多模態模型為什麼要把歸一化放在注意力層 & MLP 層的前面?

輸入的嵌入為什麼要乘以sqrt(hidden_size),而不是除以sqrt(hidden_size)?

殘差連接對於防止梯度消失有什麼意義?

這些問題會在課程中,一一為您解答。


課程內容:

如何用Pytorch製作 RoPE 旋轉位置編碼

如何用 Pytorch編寫 GQA 分組查詢注意力

如何用 Pytorch 編寫 KVCache & RMS 歸一化 & MLP 多層感知器

為什麼需要殘差連接 & 為什麼Gemma 要設定前置層歸一化 & 為什麼要乘以sqrt(hidden_size)

如何合併圖片特徵 & 文字特徵 & Pad Token ID

如何使用Pytorch 實現 PaliGemma 推理過程

Who this course is for:

  • AI/機器學習工程師 (AI/ML Engineers)
  • 數據科學家 (Data Scientists)
  • 對生成式 AI 有濃厚興趣的開發者 (Developers Interested in Generative AI)
  • 學生 (Students)