
빅데이터 분석에 대한 기본 개념 설명과 파이썬 패키지 소개
데이터 분석의 기본 개념에 대한 설명
데이터 분석을 위한 필요 역량에 대한 설명
데이터 분석과 머신러닝에 대한 관계 및 설명
데이터 양식에 대한 설명
데이터의 다양한 모양에 대한 설명
데이터의 형태에 대한 설명
데이터 처리
머신러닝의 작업 - 수치 예측과 범주 분류
수치 예측 모델이 성능 평가 방법
분류 모델의 평가 방법
파이썬 소개 및 구동 시스템 설명
파이썬의 데이터 타입 소개
파이썬의 연산자
파이썬의 함수 구성 및 활용
파이썬의 클래스 활용
파이썬 패키지 Numpy 활용
파이썬 패키지 Pandas 자료 구조 소개
시각화 패키지 Matplotlib 소개
데이터 분석을 위한 Visual Python 패키지 설치
1. Import - python 패키지 가져오기
- numpy, pandas, matplotlib 등
2. Load files - 다양한 확장자의 파일 불러오기
- csv, excel, txt, pickle 등
3. Write files - 파일 저장하기/내보내기
Data Info
General
Info
Describe
Head
Tail
Status
Null count
Duplicated
Unique
Value counts
Statistics
count, min, max, quantile, sum, mean, median, var, std, skew, kurtosis
cumsum
Correlation
Correlation table
Correlation matrix
Distribution
Histogram
Scatter matrix
Box plot
Count plot
Frame
Edit
Add column / row
Delete
Rename
As type
To Datetime
Replace
Discritize
Transform
Set index
Reset index
Data shift
Sort
Sort index
Sort values
Encoding
Label Encoding
One-Hot-Encoding
Data cleaning
Fill NA
Drop NA
Fill Outlier
Drop Outlier
Drop Duplicates
Frame
Edit
Add column / row
Delete
Rename
As type
To Datetime
Replace
Discritize
Transform
Set index
Reset index
Data shift
Sort
Sort index
Sort values
Encoding
Label Encoding
One-Hot-Encoding
Data cleaning
Fill NA
Drop NA
Fill Outlier
Drop Outlier
Drop Duplicates
원하는 조건으로 특정한 행과 열을 추출
데이터 추출 방식
subset
loc
iloc
query
조건 선택 방식
Indexing
Slicing
Condition
기준 컬럼을 중심으로 그룹핑
집계할 컬럼 선택
선택된 컬럼의 집계 데이터(합계, 평균, 분산 등)를 각 그룹별로 산출
Merge
컬럼을 기준으로 2개의 데이터를 병합
인덱스를 기준으로 2개의 데이터를 병합
데이터 병합 방식
- inner join
- outer join
- left join
- right join
Concat
2개 이상의 데이터를 병합
축 따라 이어 붙이기(가로축 병합, 세로축 병합)
데이터 병합 방식
- inner join
- outer join
1. Pivot
- Long format data --> Wide format data
2. Melt
- Wide format data --> Long format data
3 Pivot_table
- 부분 집계
데이터 시각화
1. Pandas plot
2. Matplotlib
3. Seaborn
예제 데이터를 이용한 데이터 분석 실습
- 고객 이탈률 데이터 분석
예제 데이터를 이용한 데이터 분석 실습
- 타이타닉 데이터 분석
예제 데이터를 이용한 데이터 분석 실습
- 세탁기 로그 데이터 분석
예제 데이터를 이용한 데이터 분석 실습
- 고객 이탈률 데이터 분석
예제 데이터를 이용한 데이터 분석 실습
- 문화 역세권 데이터 분석
머신 러닝 기본 개념 소개
머신 러닝 패키지 소개
- scikit-learn
Data Scaling
Feature(X값): 수치형 데이터
Standard Scaling
MinMax Scaling
Robust Scaling
Normalization Scaling
Log Scaling
Exponential Scaling
Data Encoding
Feature(X값): 범주형 데이터
Label Encoding
Ordinal Encoding
One-hot Encoding
Mean Encoding
Linear Regression
Ridge
Lasso
Elastic net
Logistic Regression
Decision Tree
Gini Index
Entroy Index
Information Gain
Random Forest
GBM - Gradient Boosting Machine
XGBoost
LightGBM
CatBoost
PCA(Principal Component Analysis) - 주성분 분석
피처 선택(Feature selection)
피처 추출(Feature extraction)
K-Means
병합군집(Agglomerative Clustering)
GMM(Gaussian Mixture Model)
DBSCAN
예제 데이터를 이용한 분류 실습
- 물고기 종류 예측
예제 데이터를 이용한 분류 실습
- 타이타닉 생존자 예측
예제 데이터를 이용한 분류 실습
- 직원 이직률 예측
예제 데이터를 이용한 분류 실습
- 고객 성별 예측
예제 데이터를 이용한 수치 예측 실습
- 중고차 판매 가격 예측
예제 데이터를 이용한 수치 예측 실습
- 자전거 대여 수요 예측
확률 분포 및 기술 통계
Normality test
Shapiro-Wilk test
Anderson-Darling test
Kolmogorov-Smirnov test
D'Agostino and Pearson's test
Jarque-Bera test
Equal Variance test
Bartlett's test
Levene's test
Fligner's test
Correlation Analysis
Pearson
Spearman
Kendall's Tau
Reliability Analysis
Cronbach's α
Chi-square test of independence
Cramer's V
Student's t-test
One-sample t-test
Independent two-sample t-test
Paired samples t-test
ANOVA - Analysis of variance
One-way ANOVA
Two-way ANOVA
ANCOVA - Analysis of covariance
Factor Analysis
KMO(Kaiser-Meyer-Olkin)
Bartlett's test of sphericity(구형성 검정)
Communalities(공통성)
Total variance explained
Regression
Simple linear regression
Multiple linear regression
Enter
Stepwise
Backward
Forward
Hierarchical linear regression
Moderated linear regression
Mediated linear regression
Dummy variable linear regression
Logistic Regression
빅데이터 분석에 대한 기본 개념을 확립하고 데이터 분석, 시각화, 머신 러닝, 통계 검정에 대한 실습을 경험할 수 있는 강의 입니다.
[강의 구성 및 내용]
1. 데이터 분석 개요
데이터 분석의 구성, 필요 역량 등을 설명하고 데이터 분석과 머신 러닝의 활용과 차이에 대해 알아봅니다.
또한 머신 러닝의 역할과 평가 방법에 대해서도 확인합니다.
2. 파이썬 기본 문법 및 패키지 활용
데이터 분석을 위한 최소한의 기초적인 파이썬 문법과 데이터 분석을 위한 패키지 활용에 대한 개념을 확립합니다.
추가적으로 IT 비전공자를 위한 데이터 분석 패키지 Visual Python을 활용한 데이터 분석을 소개합니다.
3. Visual Python - Data Analysis
Visual Python을 활용해 데이터 처리, 분석 및 시각화 실습을 진행합니다.
Python 패키지 numpy, pandas, matplotlib, seaborn등을 활용합니다.
예제 데이터를 이용해 데이터 분석 실습을 진행합니다.
4. Visual Python - Machine Learning
Visual Python을 활용해 머신 러닝 모델을 생성하고 데이터를 학습, 예측 및 평가 등의 작업을 수행합니다.
지도학습(분류, 수치 예측 등), 비지도학습(군집, 차원 축소 등) 알고리즘을 학습합니다.
Python 패키지 scikit-learn등을 활용합니다.
예제 데이터를 이용해 머신 러닝 실습을 진행합니다.
5. Visual Python - Statistics
Visual Python을 활용해 확률 분포, 기술 통계를 확인 하고 통계 검정을 수행합니다.
정규성 검정, 등분산 검정, T-검정, ANOVA, 요인 분석, 회귀 분석 등을 학습합니다.
Python 패키지 scipy, Statsmodels 등을 활용합니다.