Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
Databricks Delta Lake + NIFI: streaming e dados
Rating: 4.3 out of 5(3 ratings)
51 students

Databricks Delta Lake + NIFI: streaming e dados

Trabalhando com dados em alta escala NIFI e Databricks Delta Lake
Last updated 7/2025
Portuguese
Portuguese [Auto],

What you'll learn

  • Entendendo a arquitetura chamada Lakehouse sobre o Data Lake no Databricks
  • Construindo Delta Lake com processamento em batch, streaming em lote
  • Controle de transações sobre os dados, como um banco de dados
  • Trabalhando com características ACID (Atomicidade, Consistência, Isolamento, Durabilidade) ao Delta Lake
  • Entendendo versionamento dos dados, permite que os dados sejam acessados e revertam para versões anteriores de dados, controle de históricos
  • Uso das fases de ingestão, refinamento e enriquecimento dos dados
  • Diferenças das arquiteturas Data Lake x Delta Lake
  • Aprendendo como otimização dos processos de coleta e tratamento dos dados, reduzindo o tempo de processamento e descartando o que não for útil
  • Trabalhando a criação de tabelas Delta e como gerar históricos de dados
  • Trabalhando com cluster, DBFS, Notebook em R, Scala, Pyhton e SQL
  • Delta Time Travel como retornar versões de dados e comandos de controle
  • Controle de auditoria, agindo na conformidade de dados quanto de depuração simples para entender como os dados mu
  • Executando reversões nos dados, evitando duplicação e realizando refinamento, ajustes, atualizações e exclusões dos dados
  • Executando scripts batch e streaming
  • Entendo o que significa checkpoint e controle de gravações dos dados
  • Trabalhando com Schema Evolution na inclusão de atributos as tabelas delta
  • Entendo sobre Apache Nifi, uma plataforma de ingestão de dados
  • Entendo sobre o gerenciamento e a automatização do fluxo de dados
  • Entendendo sobre coleta de dados, transmissão de dados, armazenamento de dados
  • Ecossistema NiFi: Repositórios, controle de fluxo, máquina JVM, extensões
  • O que é Flow File
  • O que é um Processor
  • O que é um Fluxo de Dados
  • O que é uma conexão
  • O que é um grupo de processor
  • Aprendendo sobre a barra de componentes
  • Aprendendo sobre a barra de controle navegação
  • Aprendendo sobre a barra de operação
  • Desenvolvimento de diversos fluxos de dados
  • Extensões: Putfile, Getfile, ExtractText, SplitText
  • Extensões: EvaluateXpath, UpdateAttribute, GenerateFlowFile
  • Extensões: RouteOnAttribute, SplitXML, LogMessage, LogAttibute
  • Extensões: MergeContent, ReplaceText, CompressContent
  • Uso de Input Port, Funil e Process Group

Course content

2 sections27 lectures4h 17m total length
  • Introdução a Databricks Delta Lake8:56
  • INFORMAÇÕES IMPORTANTES - Leia antes de começar o curso0:23
  • Diferenças sobre Data Lake x Delta Lake10:11
  • Start Databricks e como o ambiente funciona10:54
  • Passo a passo - Criando uma conta Databricks Community Edition - Free0:08
  • Carregamento dados compras e controle de dados10:00
  • Entendo o controle de transações - Delta_log5:27
  • Describe de versões Delta Lake e restore de versões11:00
  • Carga de dados Hotel e Otimizando as consultas no Delta Lake12:36
  • Executando o processo de Delta Time Travel16:57
  • Construção de tabelas Delta e verificando o controle de transações e constraints10:40
  • Executando Streaming script e armazenando os dados em uma tabela Delta17:39
  • Utilizando Schema Evolution em tabelas Delta17:51
  • Entrega de exercício - aula final2:55
  • Responda a nossa pergunta

Requirements

  • É importante que você conheça um pouco de Python, R, Scala, SQL, não haverá treinamento destas linguagens neste curso
  • Importante conhecer execução de scripts em Python, R, Scala, SQL
  • Importante ter uma base sobre banco de dados, arquivos de dados
  • Importante que conheça lógica de programação

Description

Um dos treinamentos mais esperados pelos profissionais de dados, que unem duas grandes ferramentas muito utilizadas pelos engenheiros de dados e que estão em qualquer projeto que utilize principalmente streaming de dados, estamos falando do uso do Databricks Delta Lake e do APACHE NIFI.

Vamos iniciar nosso curso de forma incrível, trabalhando com que há de mais moderno no tratamento de dados na nuvem, faremos tudo isso no Databricks com o uso do Delta Lake. O Delta Lake é uma camada de armazenamento de código aberto que traz confiabilidade aos Data Lakes, fornecendo recursos semelhantes a data warehouse, em cima do Data Lake. Ele também pode lidar com dados de Batch e Streaming perfeitamente. E esses componentes e recursos podem ajudar a construir uma arquitetura otimizada e bem integrada do Lakehouse.

Depois vamos mergulhar no uso do APACHE NIFI, foi construído para automatizar o fluxo de dados entre os sistemas, As empresas têm mais de um sistema, onde alguns dos sistemas criam dados e alguns dos sistemas consomem dados, então o NIFI nasce no contexto de permitir a integração entre os softwares via fluxo de dados. Comumente aqui no nosso curso você vai ouvir falar um FlowFile representa cada objeto movendo-se através do sistema e para cada um.

Então, vamos começar nosso treinamento para aprender a trabalhar com estes dois gigantes da área de engenharia de dados?

Who this course is for:

  • Estudantes e profissionais de computação, Informática, estatística, data science, analista de dados, engenheiro de dados
  • Pessoas interessadas em aprender os conceitos sobre NiFi e Databricks Delta Lake, ou que gostariam adentrar na área de engenharia de dados
  • Profissionais que, de alguma forma, utilizam dados no seu dia a dia