Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
PySpark Práctico: Apache Spark para Ingenieros de Datos
Bestseller
Highest Rated
Rating: 4.6 out of 5(44 ratings)
274 students

PySpark Práctico: Apache Spark para Ingenieros de Datos

Aprende Spark con PySpark — pipelines ETL, optimización, ejercicios, cuestionarios y prácticas
Last updated 3/2026
Spanish
Spanish [Auto],

What you'll learn

  • Levantar un entorno PySpark en local o Databricks y ejecutar notebooks.
  • Leer, transformar y escribir datos usando DataFrames y Parquet.
  • Diseñar y ejecutar pipelines ETL sencillos
  • Interpretar planes de ejecución y aplicar estrategias básicas de optimización (particiones, broadcast, cache).

Course content

3 sections20 lectures2h 23m total length
  • Presentación del curso4:25
  • Introducción a PySpark7:50

    Qué es apache spark, pyspark, sus ventajas, características y aplicaciones

  • Preparar entorno: PySpark local vs Databricks Free8:27

    Instalación mínima, arranque de SparkSession, y cómo lanzar un Notebook en Databricks

  • Primer DataFrame: leer CSV y primeras transformaciones8:54

    Leer CSV, inferir/especificar esquema, mostrar/filtrar, select, withColumn, filter

  • Ejercicio Práctico0:55
  • Transformaciones vs acciones: limpiar datos y conteos6:28

    map/filter (RDD idea), acciones count(), collect() vs take(), evitar collect() en producción

  • Guardar en Parquet y particionar9:24

    Guardar resultado a Parquet, particionado por columna, leerlo de nuevo, ventajas de Parquet

  • Mini-lab: pipeline ETL corto0:42
  • Cuestionario módulo 1

Requirements

  • Conocimientos básicos de Python (sintaxis, funciones).
  • Conocimientos básicos de SQL (SELECT, group by).
  • Python instalado; para local: Java (JDK 8/11) o usar Databricks Community (alternativa).
  • No es necesario experiencia previa en Spark; el curso parte de lo básico y va a casos reales.

Description

¡Bienvenido a PySpark Práctico: Apache Spark para Ingenieros de Datos!
Este curso intensivo está pensado para que consigas resultados reales desde la primera lección: montarás un pipeline ETL, entenderás la API de DataFrames y optimizarás jobs. Ideal si quieres pasar de experimentar en pandas a procesar datos a escala con Spark.

¿Qué incluye?

  • Vídeos cortos y directos (5–10 min) para estudiar en bloques.

  • Ejemplos listos para ejecutar en Databricks o local.

  • Ejercicios de codificación prácticos por módulo.

  • Tests para autoevaluarte.

  • Proyectos entregables para tu portafolio.

¿Funcionará para mí? Sí, si sabes Python básico y SQL. El curso está pensado para llevarte paso a paso desde ejemplos sencillos hasta un mini-proyecto real. Muchas personas que venían de pandas o análisis han conseguido aplicar estos conocimientos en proyectos reales.

¿Necesito un clúster de Spark para trabajar? No: se puede practicar en local o Databricks Community; para producción verás recomendaciones de despliegue y jobs.

¿Incluye datasets? Sí: datasets de ejemplo y notebooks descargables.

Muchos alumnos comienzan sin experiencia en Spark (venían de pandas o SQL). El objetivo es el mismo que tuvieron ellos: aprender a producir resultados. Este curso te guía con pequeñas victorias. Aprender Spark implica entender distribución, particionado y cambiar mentalidad respecto a otras tecnologías como Pandas. Yo también tuve que hacer esa transición y cometí errores; por eso incluyo anti-patrones y debugging práctico (que te ahorrará semanas).

Who this course is for:

  • Analistas y Data Engineers que quieren empezar a trabajar con PySpark rápidamente.
  • Data Scientists que necesitan escalar transformaciones fuera de pandas.
  • Desarrolladores que desean entender cómo producir pipelines Spark y optimizarlos.
  • Personas que buscan ejemplos prácticos y entregables para su portafolio.