
Qué es apache spark, pyspark, sus ventajas, características y aplicaciones
Instalación mínima, arranque de SparkSession, y cómo lanzar un Notebook en Databricks
Leer CSV, inferir/especificar esquema, mostrar/filtrar, select, withColumn, filter
map/filter (RDD idea), acciones count(), collect() vs take(), evitar collect() en producción
Guardar resultado a Parquet, particionado por columna, leerlo de nuevo, ventajas de Parquet
Conceptos, rendimiento y casos de uso. Breve demo con RDD y mismo flujo con DataFrame.
Operaciones comunes y patrones de transformación
Inner, left, broadcast joins, particionamiento implicado
row_number, rank, partitionBy + ejemplos prácticos
Cómo escribir UDFs, coste, cuándo usar Pandas UDFs para rendimiento.
Crear vistas temporales y ejecutar consultas SQL; integración con BI
Construir un reporte de ventas por ventana y exportar
Por qué importa el número/tamaño de ficheros, repartition vs coalesce
cache(), niveles de persistencia, cuándo y dónde cachear
Broadcast join, broadcast() API, cómo evitar shuffle costoso
Parquet/ORC, compresión, y principios básicos de Adaptive Query Execution
¡Bienvenido a PySpark Práctico: Apache Spark para Ingenieros de Datos!
Este curso intensivo está pensado para que consigas resultados reales desde la primera lección: montarás un pipeline ETL, entenderás la API de DataFrames y optimizarás jobs. Ideal si quieres pasar de experimentar en pandas a procesar datos a escala con Spark.
¿Qué incluye?
Vídeos cortos y directos (5–10 min) para estudiar en bloques.
Ejemplos listos para ejecutar en Databricks o local.
Ejercicios de codificación prácticos por módulo.
Tests para autoevaluarte.
Proyectos entregables para tu portafolio.
¿Funcionará para mí? Sí, si sabes Python básico y SQL. El curso está pensado para llevarte paso a paso desde ejemplos sencillos hasta un mini-proyecto real. Muchas personas que venían de pandas o análisis han conseguido aplicar estos conocimientos en proyectos reales.
¿Necesito un clúster de Spark para trabajar? No: se puede practicar en local o Databricks Community; para producción verás recomendaciones de despliegue y jobs.
¿Incluye datasets? Sí: datasets de ejemplo y notebooks descargables.
Muchos alumnos comienzan sin experiencia en Spark (venían de pandas o SQL). El objetivo es el mismo que tuvieron ellos: aprender a producir resultados. Este curso te guía con pequeñas victorias. Aprender Spark implica entender distribución, particionado y cambiar mentalidad respecto a otras tecnologías como Pandas. Yo también tuve que hacer esa transición y cometí errores; por eso incluyo anti-patrones y debugging práctico (que te ahorrará semanas).