Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
Apache Spark: Expertise Avancée
Rating: 4.1 out of 5(4 ratings)
17 students

Apache Spark: Expertise Avancée

Optimisez vos traitements Big Data avec des stratégies éprouvées et avancées.
Created byMehdi Tajmouati
Last updated 7/2024
French

What you'll learn

  • Architecture Apache Spark
  • Vue d'Ensemble de l'Architecture Apache Spark
  • Rôle du Driver
  • Rôle du Executors
  • Rôle du DAG (Directed Acyclic Graph)
  • Les 5S Apache Spark
  • Spill
  • Shuffle
  • Serialization
  • Storage
  • Apache Spark – Use Case Scala Spark (Analyse des Commandes Clients)
  • Optionnel : configuration du workspace & Installation Apache Spark sur Windows
  • Read data using Spark
  • Join dataframe using SparkSQL
  • Filter dataframe using SparkSQL
  • Write dataframe result
  • Tuning de Performance de Spark

Course content

5 sections • 78 lectures • 2h 26m total length
  • Introduction1:24

    Introduction de la formation Apache Spark: Expertise Avancée

  • Sommaire2:00

    Sommaire de la formation Apache Spark: Expertise Avancée

Requirements

  • Connaissances pratiques de SQL
  • Expérience en traitement de données
  • Compréhension de base d'Apache Spark

Description

Embarquez pour une exploration approfondie et transformatrice dans le monde d'Apache Spark. Ce voyage de formation commence par les bases et vous conduit à travers une série d'étapes clairement définies jusqu'à atteindre une expertise avancée, le tout en vous immergeant dans des cas d'usage concrets utilisant Scala.


Découvrez l'architecture fondamentale de Spark, comprenez le rôle crucial du DAG (Directed Acyclic Graph), et explorez le SparkUI pour une visualisation et un débogage efficaces de vos traitements de données.


Ce cours vous plonge au cœur des cinq piliers essentiels de Spark  :


  • Spill

  • Shuffle

  • Storage

  • Serialization

  • Skew


    vous équipant des connaissances pour maîtriser les optimisations et surmonter les défis d'analyse de données à grande échelle.


Vous apprendrez non seulement à identifier et à réduire le Spill, mais aussi à optimiser le Shuffle pour des performances améliorées, à gérer efficacement le Storage pour un accès rapide aux données, à choisir les meilleures stratégies de Serialization pour vos besoins, et à équilibrer les charges de travail pour éviter le Skew.


Chaque module du cours est conçu pour renforcer votre compréhension théorique avec des applications pratiques, vous permettant d'appliquer directement ce que vous avez appris dans des scénarios réels.

Que vous soyez un développeur cherchant à élargir vos compétences en traitement de données, un analyste désireux de plonger dans le big data, ou un passionné de technologies de l'information explorant le monde de l'analyse de données, ce cours vous fournira les outils et les compétences nécessaires pour exploiter la puissance de Spark et Scala.


Préparez-vous à transformer des ensembles de données volumineux en insights précieux, à accélérer vos traitements de données, et à propulser votre carrière dans le domaine de l'analyse de données à un niveau supérieur avec notre cours complet sur Apache Spark.

Who this course is for:

  • Data Engineers
  • Data Architects
  • Data Scientists
  • Data Auditor