
Разберем, что такое машинное обучение, и посмотрим на его задачи
Разберем, как получается финальный результат машинного обучения
Разберем вопросы обогащения, очистки и загрузки данных
Разберем, зачем нужен разведочный анализ данных
Разберем нормирование данных
Посмотрим, зачем нужно разделять выборку, и как это делать
Разберем обучение модели и оптимизацию гиперпараметров
Разберем оптимальное качество обучения модели
Разберем, как работает экспорт и импорт данных в задачах машинного обучения
Исследуем правдоподобие выборки и метод максимального правдоподобия
Разберем суть МНК
Разберем интерполяция данных для заполнения пропусков
Посмотрим на метрики RMSE и RMSLE
Рассмотрим метрики расстояния, отличные от Евклидовой
Разберем оптимизацию гиперпараметров линейной регрессии
Разберем информационные критерии моделей, основанные на функции правдоподобия
Разберем базовую оценку бинарного классификатора
Посмотрим на оценки бинарного классификатора на базе точности и полноты
Посмотрим на критерий качества работы бинарной классификации по ROC AUC
Посчитаем Каппу Коэна
Посмотрим на оценку ранговой классификации
Разберем, как оптимизировать классификацию
Посмотрим на метод ближайших соседей и его проблемы при классификации
Рассмотрим задачу по классификации - вычислению класса скоринга при страховании жизни
Разберем точность, оценку F1, матрицу неточностей и каппа оценку для классификации
Разберем, как использовать ближайших соседей для классификации данных
Посмотрим, как применять условную вероятность для классификации
Разберем базовый метод классификации - логистическую регрессию
Обобщим подход ближайших соседей
Рассмотрим SVM - метод опорных векторов
Разберем предварительную обработку данных и оптимизацию по памяти
Разберем, как работает логистическая регрессия
Разберем уровневый, или иерархический, подход при построении моделей классификации
SVM: метод опорных векторов
Разберем бэггинг, бустинг и стекинг
Посмотрим на "независимые" подвыборки
Разберем бэггинг
Посмотрим, как применить бэггинг для решающих деревьев
Разберем ошибку "выпадения" данных
Поговорим про Extremely Randomized Trees
Разберемся с обучением ансамбля на ошибках предыдущих моделей
Разберем варианты адаптивного бустинга - LogitBoost и BrownBoost
Посмотрим на работу численных методов минимизации функции ошибки
Разберем работу обычного и экстремального градиентного бустинга
Посмотрим на объединение бустинга и бэггинга
Разберем, как выглядит дерево решений и как его применять на практике
Посмотрим, как можно улучшить модель решающего дерева при помощи случайного леса
Разберем градиентный бустинг
Посмотрим на отличия LightGBM от XGBoost
Посмотрим, что под капотом у CatBoost
Разберемся, как строить ансамбль стекинга
Разберем отличия LightGBM от других ансамблей градиентного бустинга
Посмотрим на CatBoost
Разберем построение ансамбля голосования моделей
Рассчитаем результат для загрузки в соревнование
Мы разберем фундаментальные и прикладные подходы к классификации данных с помощью машинного обучения для страхового скоринга Prudential в соревновании на Kaggle вплоть до формирования конечного результата с помощью ансамбля стекинга.
Курс разбит на 2 части. В первой части мы последовательно пройдем все этапы работы с данными: от видов задач и их постановки до работы с моделями машинного обучения для минимизации предсказательной ошибки. Дополнительно рассмотрим фундаментальные основы построения моделей машинного обучения, базовые метрики и наиболее простые модели - линейную и логистическую регрессии. А также метрики, модели и ансамбли классификации.
Во второй части на практике разберем:
Проведение исследовательского анализа данных для поиска зависимостей: EDA.
Метрики классификации: точность, полнота, F1, квадратичная каппа и матрица неточностей.
Очистка данных и оптимизация потребления памяти.
Кластеризация данных и метод ближайших соседей.
Простая и иерархическая логистическая регрессия.
Метод ближайших соседей и поиск оптимальной модели.
Метод опорных векторов: SVM.
Дерево принятия решения и случайный лес (бэггинг).
XGBosot и градиентный бустинг.
LightGBM и CatBoost
Ансамбль стекинга для голосования и выбора лучшего результата.
Выгрузка результата для соревнования на Kaggle.