
學員將安裝需要的軟體
學員將學會如何使用uv 作為包管理器和項目管理工具
學員將學會什麼是 Mistral & 它的核心技術
學員將學會什麼是 Sliding Window Attention & 感受野 & Causal Mask
學員將學會什麼是 KV Cache KV 快取 & Rolling Buffer Cache滾動快取緩衝區 & Prefilling 預填& Chunking 分塊處理
學員將學會如何使用 Pytroch 實現 Sliding window做 Prefill 預填充
學員將學會如何用Pytorch 實現 Unrotate 反旋轉
學員將學會什麼是稀疏混合專家模型sparse MoE 技術
學員將學會什麼是 Model Sharding 模型切片 & Pipeline Parallelism 管線平行化 & 區塊對角線因果掩碼
本課程延續Generative AI 第 18~25 部,繼續講解大語言模型架構技術的原理,圍繞Mistral 大語言模型與原始 Transformer 之間的架構差異展開。
其中包括如下技術:
Sliding Window Attention - 滑動窗口注意力:
限制注意力計算在固定大小窗口內,減少計算量
Rolling Buffer Cache - 滾動緩衝區緩存:
一種用於推理時保存中間計算結果的緩存技術
Sparse Mixture of Experts (MoE) - 稀疏混合專家模型:
利用多個專家子網絡並行處理,提升模型容量與效率
KV 緩存 - Key-Value Cache:
儲存注意力機制中Key和Value的緩存,加速推理
Feedforward Networks (Experts) - 前饋網絡(專家):
MoE中多個獨立的前饋子網絡,負責不同輸入的處理
Model Sharding - 模型分片:
將模型參數分散到多個設備上以減少單設備負擔