Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
LLM (Büyük Dil Modeli) Fine-Tuning Uzmanlığı: GRPO, SFT, DPO
Rating: 5.0 out of 5(15 ratings)
81 students

LLM (Büyük Dil Modeli) Fine-Tuning Uzmanlığı: GRPO, SFT, DPO

DeepSeek yöntemi ile LLM eğitimi: SFT, LoRA, DPO ve GRPO ile Uygulamalı Fine-Tuning ve Reinforcement Learning
Last updated 4/2025
Turkish
Turkish [Auto],

What you'll learn

  • Büyük Dil Modellerinin (LLM) temel prensiplerini ve eğitiminin genel altyapısını kavrayacaksınız
  • Base model ile Instruct model arasındaki farklar ve bunlar için veri hazırlama yöntemlerini öğreneceksiniz
  • Püf noktaları ile birlikte Veri ön işleme, modellerin beklediği özel tokenları, veri formatını bulmayı, ve veriye entegre etme yöntemlerini öğreneceksiniz
  • LoRA ve Data Collator nasıl çalışır onları uygulamalı olarak detaylı bir şekilde öğreneceksiniz
  • Eğitim için çok önemli olan hiperparemetrelerin ne iş yaradığını, nasıl çalıştığını detaylı bir şekilde öğreneceksiniz
  • Eğitilen LoRa matrisleri ile asıl model nasıl birleştirilir, birleştirirken dikkat etmemiz gereken noktalar neler uygulamalı olarak detaylı bir şekilde öğrenec
  • DPO (Direct Preference Optimization) nedir nasıl çalışır beklediği veri formatı ne, hangi durumlar kullanılır bunları öğreneceksiniz
  • DPO için veri hazırlarken dikkat etmemiz gereken noktaları ve DPO data collator nasıl çalışır öğreneceksiniz
  • DPO ile model eğitirken DPO ya özel hiperparametreler neler nasıl çalışır onları öğreneceksiniz
  • Eğitim tamamlandıktan sonra modeli Hugging Face gibi platformlara yüklemek ve hiperparametre yönetimi yapmayı öğreneceksiniz
  • GRPO (Group Relative Policy Optimization) Reinforcement Learning yöntemi nasıl çalışır ? öğrenme aşaması nasıl gerçekleşir detaylı bir şekilde öğreneceksiniz
  • GRPO (Group Relative Policy Optimization) için veri hazırlamayı öğreneceksiniz
  • GRPO (Group Relative Policy Optimization) için en kritik nokta olan ödül fonksiyonları yazmayı çeşitli örnek ödül fonksiyonlari ile öğreneceksiniz
  • GRPO için ödül fonksiyonlarına veriler hangi formatta gidiyor ? Fonksiyonlar içinde verileri nasıl işleriz ?
  • Fonksiyonlar içinde ödülleri nasıl tanımlarız template nasıl belirleriz ?
  • Ham cevap içinden ödül vereceğimiz kısımları nasıl alıp ödül tanımlarız ? gibi bir çok detayı uygulamalı olarak öğreneceksiniz
  • Instruct model GRPO ile düşünen diye tabir edilen "chain of thoughts" üreten modele nasıl dönüştürülür onu öğreneceksiniz
  • Ve daha bir çok detayı uygulamalı olarak öğreneceksiniz

Course content

5 sections • 41 lectures • 3h 50m total length
  • Giriş1:15
  • Kurs İçeriği Tanıtım7:17
  • Notebooklar

Requirements

  • Temel Python programlama bilgisi
  • Yapay zeka ve makine öğrenmesi kavramlarına giriş seviyesinde aşinalık
  • İdeal olarak Jupyter Notebook veya Google Colab deneyimi

Description

Bu kursta, Büyük Dil Modelleri (LLM) dünyasına adım atarak hem temel hem de ileri düzey optimizasyon yöntemlerini uçtan uca öğreneceksiniz. Eğitime SFT (Supervised Fine-Tuning) yaklaşımıyla başlayıp, veriyi doğru biçimde hazırlamayı, tokenizer ve data collator kullanarak özelleştirilmiş veri setleri oluşturmayı pratik örnekler eşliğinde göreceksiniz. SFT sürecinde LoRA (Low-Rank Adaptation) ve quantization yöntemleriyle büyük modelleri daha hafif ve daha verimli hale getirmenin püf noktalarını öğrenecek, projelerinizde nasıl kullanabileceğinizi adım adım keşfedeceksiniz.


SFT temellerini sağlamlaştırdıktan sonra, DPO (Direct Preference Optimization) bölümüne geçeceğiz. DPO, kullanıcı geri bildirimlerini modele doğrudan yansıtarak kullanıcı odaklı sonuçlar elde etme imkânı sunar. Veriyi hangi formatta hazırlamamız gerektiğini, bu yöntemi uygularken nasıl bir ödül mekanizması kurgulayabileceğimizi ve Hugging Facegibi popüler platformlarda eğitilen modelleri nasıl paylaşabileceğinizi göreceksiniz. Ayrıca DPO süreçlerinde data collator mantığını daha derinlemesine anlayarak, farklı senaryolar için veri seti hazırlama ve dönüştürme pratiklerini öğreneceksiniz.


Kursun en önemli aşaması, giderek popülerleşen ve güçlü sonuçlar üreten GRPO (Group Relative Policy Optimization) tekniğidir. GRPO ile sadece bireysel değil, topluluk içi veya farklı kullanıcı grupları arasında da model davranışını optimize etmenin yöntemlerini öğreneceksiniz. Bu sayede büyük dil modellerinin farklı kitlelere veya farklı amaçlara hizmet etmesini sağlamak daha sistematik ve etkili hale geliyor. Kursta GRPO’nun temel prensiplerini öğrenecek, ardından gerçek veri setleri üzerinde uygulamalı örnekler yaparak tekniği pekiştireceksiniz.


Eğitim boyunca, LoRA, quantization, SFT, DPO ve özellikle GRPO gibi kilit başlıkları bir arada işleyerek, her birini proje odaklı uygulamalarla destekleyeceğiz. Sonuç olarak, bu kursu tamamladığınızda, uçtan uca veri hazırlamadan model ince ayarına ve grup bazlı politika optimizasyonuna kadar tüm aşamaları güvenle yönetebileceksiniz. Kendi projelerinizde hem performans hem de kullanıcı memnuniyeti odaklı, modern ve rekabetçi LLM çözümleri geliştirmek artık çok daha kolay olacak!

Who this course is for:

  • LLM eğitim tekniklerinde uzmanlık kazanmak isteyen veri bilimciler ve ML mühendisleri
  • Veri hazırlamanın püf noktalarını öğrenmek isteyenler
  • Kendi özelleştirilmiş dil modellerini geliştirmek isteyen yapay zeka geliştiricileri
  • SFT (Supervised Fine-Tuning), DPO (Direct Preference Optimization), GRPO (Group Relative Policy Optimization) gibi ileri seviye teknikleri uygulamalı öğrenmek isteyenler
  • GRPO (Group Relative Policy Optimization) tekniğini uygulamalı olarak öğrenmek isteyen
  • Veri hazırlamanın püf noktalarını öğrenmek ve kendi özel veri setlerini oluşturarak dil modellerine uyarlamak isteyenler
  • Reinforcement Learning yöntemlerine ilgisi olan, modeli kullanıcı geri bildirimine göre optimize etmek isteyenler.