Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
(Ken Cen出品)Generative AI第26部 Mistral 語言模型的架構秘密
Rating: 5.0 out of 5(2 ratings)
82 students

(Ken Cen出品)Generative AI第26部 Mistral 語言模型的架構秘密

關於Sliding Window Attention,Rolling Buffer Cache,MoE,Key-Value Cache,Experts
Created byKen Cen
Last updated 10/2025
Chinese (Traditional)
Chinese (Traditional) [Auto],

What you'll learn

  • 瞭解Mistral 語言模型的Sliding Window Attention 技術
  • 瞭解Mistral 語言模型的Rolling Buffer Cache 技術
  • 瞭解Mistral 語言模型的Sparse Mixture of Experts (MoE) 技術
  • 瞭解Mistral 語言模型的Model Sharding技術

Course content

5 sections10 lectures6h 29m total length
  • 加入Udemy 全球最大的中文 AI 課程2:16
  • 課程工具準備2:41

    學員將安裝需要的軟體

  • 如何使用uv 作為包管理器和項目管理工具10:53

    學員將學會如何使用uv 作為包管理器和項目管理工具

Requirements

  • 一臺電腦

Description

本課程延續Generative AI 第 18~25 部,繼續講解大語言模型架構技術的原理,圍繞Mistral 大語言模型與原始 Transformer 之間的架構差異展開

其中包括如下技術:

Sliding Window Attention - 滑動窗口注意力:

限制注意力計算在固定大小窗口內,減少計算量


Rolling Buffer Cache - 滾動緩衝區緩存:

一種用於推理時保存中間計算結果的緩存技術


Sparse Mixture of Experts (MoE) - 稀疏混合專家模型:

利用多個專家子網絡並行處理,提升模型容量與效率


KV 緩存 - Key-Value Cache:

儲存注意力機制中Key和Value的緩存,加速推理


Feedforward Networks (Experts) - 前饋網絡(專家):

MoE中多個獨立的前饋子網絡,負責不同輸入的處理


Model Sharding - 模型分片:

將模型參數分散到多個設備上以減少單設備負擔

Who this course is for:

  • AI/ML 研究者與工程師
  • 數據科學家與視覺工程師
  • 所有對 AI 藝術與創新應用有興趣者