
В этом видео дается общая информация о кластерном анализе и об этом курсе.
Рассказывается о структуре курса.
В этой серии мы приступим к изучению одной из наиболее популярных разновидностей кластерного анализа - иерархического кластерного анализа.
Мы начнем рассматривать практическую задачу по кластеризации и изучим, как кластерный анализ предлагает оценивать схожесть (или несхожесть) объектов.
В серии будет рассмотрен:
евклидов метод измерения расстояний между объектами
Мы продолжим решение практической задачи, начатое в предыдущей серии и рассмотрим:
как строится матрица расстояний между объектами
на каких принципах на основе матрицы расстояний выделяются кластеры
как определяется расстояние между кластером и объектом
Завершающая серия, посвященная решению практической задачи, которая посвящена:
определению расстояния между двумя кластерами
построению дендрограммы
обсуждению полученных результатов кластеризации
вопросу об устойчивости полученной кластеризации
В этой серии рассматривается задача кластеризации объектов в трехмерном пространстве и показывается, как можно беспрепятственно увеличивать размерность пространства (т.е. увеличиваться количество учитываемых свойств объектов).
Также показывается более экономичный вариант анализа матрицы расстояний.
Показываются варианты визуализации результатов кластерного анализа с помощью дендрограмм и диаграмм рассеивания, а также способы повышения их наглядности.
Это одна из ключевых серий курса. В ней рассказывается, какие допущения делает исследователь в процессе кластерного анализа и к чему они приводят.
Но можно сказать и по-другому: эта серия про те широкие возможности, которые предоставляет исследователю кластерные анализ.
Вы узнаете:
о том, что существуют различные варианты измерения расстояний между объектами (рассмотренный ранее евклидов метод - не единственный вариант)
что есть разные методы измерения расстояния между кластером и объектом и между двумя кластерами
что делать, если свойства ваших объектов имеют разные шкалы измерения
В результате просмотра этой серии вы узнаете:
как проводить кластерный анализ с использованием манхэттенских расстояний
как могут измениться результаты анализа при изменении метода измерения расстояний
После просмотра этой лекции вы узнаете, в чем отличается метод "дальнего соседа" от метода "ближнего соседа", и научитесь проводить кластеризацию с его помощью.
В этой и следующей сериях на конкретном примере мы рассмотрим довольно экзотичный способ определения схожести между объектами - при помощи коэффициента линейной корреляции Пирсона.
Самое главное - вы поймете, чем этот способ отличается от других рассмотренных вариантов кластерного анализа и для решения какого рода задач он может быть полезен.
Продолжение предыдущей серии про использование коэффициента линейной корреляции Пирсона
В двух сериях мы рассмотрим еще один популярный метод кластеризации - метод К-средних. Вы узнаете, в чем его отличие от иерархического кластерного анализа и увидите на уже знакомом примере, каков алгоритм действий при его проведении.
Продолжение предыдущей серии про использование метода К-средних.
После просмотра этой лекции вы научитесь производить иерархический кластерный анализ с помощью языка программирования R :
создавать массивы данных в R (то есть представлять ваши исходные данные в виде, необходимом для их анализа в R)
формировать в R матрицы расстояний между объектами, задавая различные способы измерения этих расстояний
строить в R дендрограммы, задавая варианты измерения расстояний между кластером и объектом и между двумя кластерами
Кластерный анализ применяется везде, где идет речь о группировке или классификации объектов - будь то группировка товаров на рынке, потенциальных покупателей, политических лидеров или стран. Кластеризация активно используется в машинном обучении.
Этот курс поможет вам разобраться, что такое кластерный анализ, и вы научитесь выполнять его своими руками. Вы получите пошаговые инструкции различных вариантов группировки и классификации объектов, визуализации результатов, а также использования языка R для этих целей.
Мы изучим ключевые идеи кластерного анализа и его популярные разновидности – иерархический анализ и метод К-средних. Изучим, как строить и анализировать матрицы расстояний и как рисовать дендрогаммы.
Курс является, скорее, прикладным, нежели теоретическим – мы в большей степени будем говорить о том, как проводить кластерный анализ на конкретных примерах.
Этот курс создан для студентов (а может, и школьников), начинающих специалистов в области data science, которые хотят понять, как и в каких случаях применять кластерный анализ, что он вообще делает, и при этом не обладают глубокими математическими знаниями. Самое сложное, о чем мы будем говорить (с точки зрения математики), – это квадратный корень и теорема Пифагора. Самое главное, что я хочу сказать, - что кластерный анализ не так сложен, как кажется; его довольно легко понять и освоить.
Присоединяйтесь к курсу и удачи вам в освоении кластерного анализа и его различных вариантов!