Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
Машинное обучение: классификация и ансамбли на Python
Rating: 3.9 out of 5(8 ratings)
70 students

Машинное обучение: классификация и ансамбли на Python

Выигрываем соревнование Kaggle с kNN, SVM, логистической регрессией, случайным лесом, XGBoost, CatBoost и LightGBM
Last updated 6/2021
Russian

What you'll learn

  • EDA: исследовательский анализ данных
  • Точность, полнота, F1 и каппа метрики
  • Простая классификация данных
  • Логистическая регрессия: простая и многоуровневая
  • Метод ближайших соседей: kNN
  • Наивный Байес
  • Метод опорных векторов: SVM
  • Решающие деревья м случайный лес
  • XGBoost и градиентный бустинг
  • CatBoost и LightGBM
  • Ансамбль голосования и стекинга

Course content

10 sections56 lectures8h 46m total length
  • Задачи машинного обучения9:51

    Разберем, что такое машинное обучение, и посмотрим на его задачи

  • Задачи машинного обучения
  • Модель и процесс машинного обучения7:47

    Разберем, как получается финальный результат машинного обучения

  • Что такое ETL6:09

    Разберем вопросы обогащения, очистки и загрузки данных

  • Процесс машинного обучения
  • Что такое EDA7:18

    Разберем, зачем нужен разведочный анализ данных

  • Подготовка данных13:06

    Разберем нормирование данных

  • Подготовка данных
  • Разбиение выборки9:53

    Посмотрим, зачем нужно разделять выборку, и как это делать

  • Оптимизация гиперпараметров12:40

    Разберем обучение модели и оптимизацию гиперпараметров

  • Недообучение и переобучение10:55

    Разберем оптимальное качество обучения модели

  • Смещение, разброс и ошибка данных10:25
  • Обучение модели
  • Использование HDF6:53

    Разберем, как работает экспорт и импорт данных в задачах машинного обучения

Requirements

  • Продвинутый Python
  • Основы математической статистики

Description

Мы разберем фундаментальные и прикладные подходы к классификации данных с помощью машинного обучения для страхового скоринга Prudential в соревновании на Kaggle вплоть до формирования конечного результата с помощью ансамбля стекинга.

Курс разбит на 2 части. В первой части мы последовательно пройдем все этапы работы с данными: от видов задач и их постановки до работы с моделями машинного обучения для минимизации предсказательной ошибки. Дополнительно рассмотрим фундаментальные основы построения моделей машинного обучения, базовые метрики и наиболее простые модели - линейную и логистическую регрессии. А также метрики, модели и ансамбли классификации.

Во второй части на практике разберем:

  • Проведение исследовательского анализа данных для поиска зависимостей: EDA.

  • Метрики классификации: точность, полнота, F1, квадратичная каппа и матрица неточностей.

  • Очистка данных и оптимизация потребления памяти.

  • Кластеризация данных и метод ближайших соседей.

  • Простая и иерархическая логистическая регрессия.

  • Метод ближайших соседей и поиск оптимальной модели.

  • Метод опорных векторов: SVM.

  • Дерево принятия решения и случайный лес (бэггинг).

  • XGBosot и градиентный бустинг.

  • LightGBM и CatBoost

  • Ансамбль стекинга для голосования и выбора лучшего результата.

  • Выгрузка результата для соревнования на Kaggle.

Who this course is for:

  • Аналитики Python, изучающие машинное обучение
  • Программисты больших данных
  • Исследователи больших данных