Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
Engenharia de Dados com Databricks, Spark e PySpark
Rating: 4.4 out of 5(570 ratings)
2,447 students

Engenharia de Dados com Databricks, Spark e PySpark

Aprenda as Ferramentas Essenciais para Manipulação e Análise de Grandes Volumes de Dados
Created byAndré Rosa
Last updated 2/2026
Portuguese
Portuguese [Auto],

What you'll learn

  • Configurar e Gerenciar Clusters no Databricks
  • Manipular e Transformar Dados com PySpark
  • Implementar Pipelines de Dados com Delta Lake
  • Implementar Arquitetura Medallion, Lakehouse e Delta Lake
  • Implementar Rotinas de manutenção (Vacum, Optimize, repartition, time travel entre outras)

Course content

13 sections66 lectures4h 58m total length
  • Apresentação do instrutor1:50

    Nesta aula você ira aprender sobre: Apresentação do instrutor

  • Síntese do curso de Pyspark com Databricks4:11

    Aula Síntese do curso

  • Boas Vindas, Dicas e Material para Download0:01
  • Notebooks Adaptados para Databricks Free Edition0:54

    ? Atualização do Curso: Adaptação para o Databricks Free Edition

    Olá, pessoal!

    Recentemente, o Databricks passou por uma mudança importante: a antiga versão Community Edition foi descontinuada e substituída pela nova Free Edition, que traz uma arquitetura baseada em serveless e o uso de Volumes para armazenamento de dados.

    Durante o curso que gravei anteriormente, utilizávamos um ambiente com clusters dedicados e o sistema de arquivos DBFS (Databricks File System). Agora, com a Free Edition, foi necessário adaptar os códigos e a estrutura para funcionar corretamente nesse novo modelo.

    ?️ O que foi ajustado:

    • Substituição do uso de dbfs:/ por caminhos compatíveis com Volumes, que são a nova forma de gerenciar dados no ambiente serverless.

    • Remoção de comandos que dependiam de configurações específicas de cluster.

    • Adaptação dos notebooks para rodarem em notebooks interativos serverless, sem necessidade de iniciar ou configurar clusters manualmente.


    ? Comparativo: Community Edition vs Free Edition do Databricks

    ? Antes: Community Edition

    • Utilizava clusters dedicados, que precisavam ser criados e configurados manualmente.

    • Armazenamento feito via DBFS (dbfs:/), acessado diretamente pelos notebooks.

    • Maior controle sobre recursos computacionais, como tipo de máquina e escalabilidade.

    • Execução dependia da inicialização do cluster, o que podia gerar tempo de espera.

    • Acesso direto a arquivos e pastas no sistema de arquivos do Databricks.

    ? Agora: Free Edition

    • Ambiente serverless, sem necessidade de configurar ou iniciar clusters.

    • Armazenamento feito via Volumes, que são gerenciados por catálogos e mais seguros.

    • Execução dos notebooks é automática e instantânea, com menos fricção para iniciantes.

    • Acesso aos dados é feito por meio de referências a Volumes, não mais por caminhos dbfs:/.

    • Interface mais simplificada, ideal para aprendizado e prototipagem rápida.


    Essas mudanças tornam o ambiente mais acessível e rápido para quem está começando, mas exigem alguns ajustes nos materiais anteriores. Fico feliz em poder contribuir com essa transição e manter o conteúdo atualizado para todos.

Requirements

  • Noções basicas de engenharia de dados e big data
  • Conhecimentos básicos de Python e SQL

Description

Este curso abrangente foi projetado para fornecer aos alunos as habilidades necessárias para trabalhar com grandes volumes de dados utilizando as ferramentas mais avançadas do mercado.


Você aprenderá a:


  • Configurar e Gerenciar Clusters no Databricks: Entenda a arquitetura do Databricks e como configurar clusters para otimizar o processamento de dados.

  • Manipular e Transformar Dados com PySpark: Utilize PySpark para realizar transformações complexas e análises de dados em larga escala.

  • Implementar Pipelines de Dados com Delta Lake: Aprenda a criar e gerenciar pipelines de dados robustos e eficientes utilizando Delta Lake.

  • Realizar Análises Avançadas: Aplique técnicas de análise de dados para extrair insights valiosos dos seus dados.

  • Rotinas de Manutenção de Delta Lake: Implemente rotinas de manutenção para garantir a integridade e eficiência dos seus dados.

  • Architecture Medallion: Utilize a arquitetura Medallion para organizar e arquivar seus dados de forma eficiente.

  • Boas Práticas de Desenvolvimento: Adote as melhores práticas para desenvolvimento de pipelines de dados.


O que você vai aprender:

  • Fundamentos do Apache Spark e PySpark

  • Configuração e uso do Databricks

  • Criação e gerenciamento de tabelas Delta

  • Transformações e manipulações de dados com PySpark

  • Implementação de pipelines de dados

  • Análise de dados

  • Rotinas de manutenção de Delta Lake

  • Boas práticas de desenvolvimento

  • Armazenamento Arquitetura Medallion.

Inscreva-se!

Começe a aprender e trabalhar com Databricks e Pyspark as poderosas ferramenta de Big Data e também uma das habilidades requeridas .

Além de diversas dicas pontuais no decorrer das aulas! Você terá:

+ Suporte

+Acesso Vitalício

+Garantia do retorno de seu investimento em até 30 dias.


Matricule-se!

Esperamos você na primeira aula!

Grande Abraço!

Who this course is for:

  • Estudantes e entusiastas que desejam aprender
  • Este curso é ideal para engenheiros de dados, cientistas de dados e desenvolvedores que desejam aprimorar suas habilidades em manipulação e análise de grandes volumes de dados utilizando Databricks, Spark e PySpark.
  • Profissionais que desejam consolidar conhecimentos