
Nesta aula você ira aprender sobre: Apresentação do instrutor
Aula Síntese do curso
? Atualização do Curso: Adaptação para o Databricks Free Edition
Olá, pessoal!
Recentemente, o Databricks passou por uma mudança importante: a antiga versão Community Edition foi descontinuada e substituída pela nova Free Edition, que traz uma arquitetura baseada em serveless e o uso de Volumes para armazenamento de dados.
Durante o curso que gravei anteriormente, utilizávamos um ambiente com clusters dedicados e o sistema de arquivos DBFS (Databricks File System). Agora, com a Free Edition, foi necessário adaptar os códigos e a estrutura para funcionar corretamente nesse novo modelo.
?️ O que foi ajustado:
Substituição do uso de dbfs:/ por caminhos compatíveis com Volumes, que são a nova forma de gerenciar dados no ambiente serverless.
Remoção de comandos que dependiam de configurações específicas de cluster.
Adaptação dos notebooks para rodarem em notebooks interativos serverless, sem necessidade de iniciar ou configurar clusters manualmente.
? Comparativo: Community Edition vs Free Edition do Databricks
? Antes: Community Edition
Utilizava clusters dedicados, que precisavam ser criados e configurados manualmente.
Armazenamento feito via DBFS (dbfs:/), acessado diretamente pelos notebooks.
Maior controle sobre recursos computacionais, como tipo de máquina e escalabilidade.
Execução dependia da inicialização do cluster, o que podia gerar tempo de espera.
Acesso direto a arquivos e pastas no sistema de arquivos do Databricks.
? Agora: Free Edition
Ambiente serverless, sem necessidade de configurar ou iniciar clusters.
Armazenamento feito via Volumes, que são gerenciados por catálogos e mais seguros.
Execução dos notebooks é automática e instantânea, com menos fricção para iniciantes.
Acesso aos dados é feito por meio de referências a Volumes, não mais por caminhos dbfs:/.
Interface mais simplificada, ideal para aprendizado e prototipagem rápida.
Essas mudanças tornam o ambiente mais acessível e rápido para quem está começando, mas exigem alguns ajustes nos materiais anteriores. Fico feliz em poder contribuir com essa transição e manter o conteúdo atualizado para todos.
Nesta aula você ira aprender sobre: O que é o Databricks?
Nesta aula você ira aprender sobre: Criando sua Conta Databricks Comunnity (Free)
Nesta aula você ira aprender sobre: Conhecendo e Montagem DBFS (Databricks File System )
Nesta aula você ira aprender sobre: Conhecendo e Montagem DBFS (Databricks File System )
Nesta aula você ira aprender sobre: Importando arquivos
Nesta aula você ira aprender sobre: 5 V´s de Big Data
Nesta aula você ira aprender sobre: Q que é Data Lake
Nesta aula você ira aprender sobre: Q que é Lakehouse
Nesta aula você ira aprender sobre: Checklist para Implementar o Delta Lake
Nesta aula você ira aprender sobre: Diferença DW e Data Lake
Nesta aula você ira aprender sobre: Arquitetura Medallion
Nesta aula você ira aprender sobre: Exemplo de Esrtruturação de Lakehouse (Medallion)
Nesta aula você ira aprender sobre: Arquitetura Lambda
Nesta aula você ira aprender sobre: SCD (Slowly Changing Dimensions)
Nesta aula você ira aprender sobre: Tipo de arquivos (Datalake / Lakehouse)
Nesta aula você ira aprender sobre: Comparativo Parquet e Delta Parquet
Nesta aula você ira aprender sobre: Planejando seu Datalake / Lakehouse
Nesta aula você ira aprender sobre: O que é Apache Spark ?
Nesta aula você ira aprender sobre: O que é Pyspark?
Nesta aula você ira aprender sobre: Boas práticas de desenvolvimento
Nesta aula você ira aprender sobre: Boas práticas de Estruturação
Nesta aula você ira aprender sobre: Trabalhando com Dataframes
Nesta aula você ira aprender sobre: Desempenho Pyspark
Apresentação do Case
Nesta aula você ira aprender sobre: Reativando Cluster Spark
Nesta aula você ira aprender sobre: Lendo dados na Landing Zone e persistindo na Bronze Parte 1
Nesta aula você ira aprender sobre: Lendo dados na Landing Zone e persistindo na Bronze Parte 2
Nesta aula você ira aprender sobre: Movendo arquivos processados
Nesta aula você ira aprender sobre: Gerenciamento de memória
Nesta aula você ira aprender sobre: Overview Gerenciamento de memória
Nesta aula você ira aprender sobre: Transformações Camada Silver
Nesta aula você ira aprender sobre: Persistir dados Camada Silver no formato Parquet
Nesta aula você ira aprender sobre: Leitura de dados na camada Silver para criação de Delta Parquet
Nesta aula você ira aprender sobre: Criação de tabela Delta Parquet dim_produto
Nesta aula você ira aprender sobre: Criação de tabela Delta Parquet dim_categoria
Nesta aula você ira aprender sobre: Criação de tabela Delta Parquet dim_segmento
Nesta aula você ira aprender sobre: Criação de tabela Delta Parquet dim_fabricante
Nesta aula você ira aprender sobre: Criação de tabela Delta Parquet dim_cliente
Nesta aula você ira aprender sobre: Criação de tabela Delta Parquet fato_vendas
Nesta aula você ira aprender sobre: Evidencias do Arquivos Delta Parquet
Nesta aula você ira aprender sobre: Importandos dados novos
Nesta aula você ira aprender sobre: Carga Bronze
Nesta aula você ira aprender sobre: Carga Silver
Nesta aula você ira aprender sobre: Carga Gold (dimensões)
Nesta aula você ira aprender sobre: Carga Gold (Fato)
Nesta aula você ira aprender sobre: Orquestração de notebook com Workflow
Nesta aula você ira aprender sobre: Consultas Otimizadas
Nesta aula você ira aprender sobre: Predicate Pushdown
Nesta aula você ira aprender sobre: Broadcast Join
Este curso abrangente foi projetado para fornecer aos alunos as habilidades necessárias para trabalhar com grandes volumes de dados utilizando as ferramentas mais avançadas do mercado.
Você aprenderá a:
Configurar e Gerenciar Clusters no Databricks: Entenda a arquitetura do Databricks e como configurar clusters para otimizar o processamento de dados.
Manipular e Transformar Dados com PySpark: Utilize PySpark para realizar transformações complexas e análises de dados em larga escala.
Implementar Pipelines de Dados com Delta Lake: Aprenda a criar e gerenciar pipelines de dados robustos e eficientes utilizando Delta Lake.
Realizar Análises Avançadas: Aplique técnicas de análise de dados para extrair insights valiosos dos seus dados.
Rotinas de Manutenção de Delta Lake: Implemente rotinas de manutenção para garantir a integridade e eficiência dos seus dados.
Architecture Medallion: Utilize a arquitetura Medallion para organizar e arquivar seus dados de forma eficiente.
Boas Práticas de Desenvolvimento: Adote as melhores práticas para desenvolvimento de pipelines de dados.
O que você vai aprender:
Fundamentos do Apache Spark e PySpark
Configuração e uso do Databricks
Criação e gerenciamento de tabelas Delta
Transformações e manipulações de dados com PySpark
Implementação de pipelines de dados
Análise de dados
Rotinas de manutenção de Delta Lake
Boas práticas de desenvolvimento
Armazenamento Arquitetura Medallion.
Inscreva-se!
Começe a aprender e trabalhar com Databricks e Pyspark as poderosas ferramenta de Big Data e também uma das habilidades requeridas .
Além de diversas dicas pontuais no decorrer das aulas! Você terá:
+ Suporte
+Acesso Vitalício
+Garantia do retorno de seu investimento em até 30 dias.
Matricule-se!
Esperamos você na primeira aula!
Grande Abraço!