
Aprenderemos sobre los conceptos básicos sobre el ambiente de Pyspark
El orden para ver los videos y archivos es la siguiente:
1) Video de curso de pyspark sobre ubuntu modulo2
2) Ver archivo PDF para poder copiar los link
3) Ver video: Uso de Ubuntu (basico)
En esta sección podrán encontrar los siguientes recursos:
1) Archivo para jupyter notebook con toda la corrida sobre Pyspark y los diferentes modelos de ML: cursoPyspark2.ipynb
2) Archivo comprimido RAR que contiene los datos de inflación que usamos para el desarrollo de los modelos: infla2.csv.
3) 2 videos : Modulo1_clase_2_4_720p.mp4 y Modulo1_clase_3_4_720p.mp4 donde podran acceder a la explicacion del algoritmo del Gradient Descent.
NOTA 1: El archivo inflaSAR.csv que leemos y cargamos como data final para la corrida de los modelos, se encuentra en el directorio infla3 que se crea cuando exportamos el dataFrame. Debemos entrar en el directorio infla3 tomar el archivo plano renombrarlo como inflaSAR.csv y moverlo al directorio raiz del proyecto.
NOTA 2: NO PUDE SUBIR EL ARCHIVO CON LA MAQUINA VIRTUAL YA QUE TIENE 25GB DE TAMANO Y LA PLATAFORMA DE UDEMY SOLO ACEPTA LASTA 1 GB. SI NECESITAN ESTE ARCHIVO SOLO HAGANMELO SABER PARA COMPARTIRLO DESDE GOOGLE DRIVE Y ASI LO PUEDAN BAJAR
En esta clase estaremos viendo la corrida completa sobre el archivo .iypnb que contiene la corrida completa de Pysaprk con los diferentes modelos de ML
En este modulo les dejo artículos de interés y un video para aprender un poco sobre la vectorizacion en los lenguajes com Python, Matlab.
Este es un curso que esta diseñado para personas que deseen adquirir el conocimiento básico para trabajar con Pyspark en un entorno de maquina virtual usando el sistema operativo Linux-Ubuntu. Aprenderemos a instalar el ambiente de trabajo para Pyspark usando una maquina virtual con Ubuntu y crearemos un archivo de trabajo para jupyter notebook con una secuencia clásica de carga de datos desde un archivo csv, limpieza, creacion sub dataframes y corrida de algoritmos de ML. Trabajaremos con los algoritmos de Regresión lineal, Decision tree regression, Gradient Boosting regresión y neural network usando la librería de Keras. Solamente explicaremos el algoritmo de Gradiente descendiente por su importancia ya que la mayoría de estos algoritmos usan el Gradiente descendiente para obtener el menor loss function. Tambien trabajaremos con los dataFrames de Pandas y de Pyspark para entender sus diferencias. Asimismo, sera importante entender lo poderoso de los RDD que son los que permiten el procesado distribuido para el ambiente de Big Data. El estudiante podrá descargar la maquina virtual y el archivo para jupyter notebook con las tareas ya trabajadas allí, pero esperamos que cada estudiante pueda instalar su propia maquina virtual usando la guía ofrecida con este curso. Yo estaré a su disposición para ayudarles en la creación de la MV.