Escolha o seu idioma
Curso de Machine Learning Aplicado no Databricks
Mais de 2 milhões de estudantes em todo o mundo

Curso de Machine Learning Aplicado no Databricks

Domine a aprendizagem automática de ponta a ponta na Databricks Lakehouse Platform — desde a ingestão de dados e engenharia de características até ao treino distribuído, disponibilização de modelos e MLOps em produção. Este curso prático equipa cientistas de dados e engenheiros de ML com as ferramentas, fluxos de trabalho e práticas de governação que potenciam sistemas de IA empresariais reais.

Dedika para empresas

O que vai aprender:

  • Configure clusters do Databricks, integrações de armazenamento e Unity Catalog para fluxos de trabalho de ML seguros.

  • Construa pipelines escaláveis do Delta Lake que fornecem dados limpos e versionados prontos para treino de modelos.

  • Conceba e governe tabelas de características reutilizáveis utilizando o Feature Store do Databricks para eliminar o desvio entre treino e inferência.

  • Registe, acompanhe e promova modelos através de um ciclo de vida do MLflow governado, desde a experimentação até à produção.

  • Implemente endpoints de inferência em tempo real e por lotes com lógica PyFunc personalizada e monitorização automatizada.

  • Implemente pipelines de CI/CD, deteção de desvio e retreino automatizado para operar sistemas de ML em produção de forma fiável.

Como estuda de forma prática Curso de Machine Learning Aplicado no Databricks

Como pratica Curso de Machine Learning Aplicado no Databricks

Para si que é empresa e quer formar a equipa

Na Dedika para empresas, o curso inclui exercícios e exemplos adaptados ao seu próprio negócio e às necessidades da sua empresa.

Clique aqui

Conteúdo do curso

8 Capítulos • 40 AulasDuração entre 4 e 360 horas (você decide)

Capítulo 1Ver detalhes

Databricks Plataforma Fundamentos

  • Aula 1 • Blocos de Notas e Desenvolvimento Colaborativo

    Apresenta a criação de blocos de notas, comandos mágicos e funcionalidades de coautoria. Estabelece hábitos de desenvolvimento reprodutíveis utilizados em todas as experiências de ML posteriores.

  • Aula 2 • Arquitetura do Espaço de Trabalho e Navegação

    Abrange o plano de controlo, o plano de dados e a interface de utilizador do espaço de trabalho do Databricks. Fundamenta os formandos no ambiente que utilizarão ao longo de todos os capítulos seguintes.

  • Aula 3 • Acesso a Dados e Integração de Armazenamento

    Explica pontos de montagem, Unity Catalog e gestão de credenciais para armazenamento na cloud. Permite um acesso seguro e consistente aos dados necessário para pipelines de ML.

  • Aula 4 • Noções Básicas da CLI e API REST do Databricks

    Apresenta o controlo programático do espaço de trabalho através da CLI e endpoints REST. Prepara os formandos para automatizar tarefas e integrar o Databricks em cadeias de ferramentas externas.

  • Aula 5 • Configuração e Gestão de Clusters

    Ensina tipos de clusters, versões de runtime e políticas de escalamento automático. Os formandos configuram clusters de tarefa e interativos adequados a cargas de trabalho de ML.

Capítulo 2Ver detalhes

Engenharia de Dados para Pipelines de ML

  • Aula 1 • Delta Live Tables para Orquestração de Pipelines

    Apresenta definições declarativas de pipelines, expectativas e rastreio de linhagem. Automatiza a aplicação da qualidade de dados em várias etapas antes de as caraterísticas chegarem ao treino do modelo.

  • Aula 2 • Transformação de Dados com Spark SQL

    Abrange agregações, funções de janela e manipulação de tipos complexos em Spark SQL. Transforma dados brutos em caraterísticas estruturadas consumidas por modelos de ML.

  • Aula 3 • Conceitos Fundamentais do Apache Spark

    Abrange RDDs, DataFrames e o modelo de execução do Spark. Fornece a base computacional para todas as tarefas de processamento de dados em capítulos posteriores de ML.

  • Aula 4 • Delta Lake para Cargas de Trabalho de ML

    Apresenta transações ACID, viagem no tempo e otimização de tabelas Delta. Garante fiabilidade e reprodutibilidade dos dados em experiências iterativas de ML.

  • Aula 5 • Padrões de Ingestão de Dados

    Ensina ingestão em lote e em fluxo a partir de ficheiros, bases de dados e fluxos de eventos. Os formandos constroem pipelines fiáveis de origem para zona de destino para criação de caraterísticas de ML.

Capítulo 3Ver detalhes

Engenharia de Caraterísticas e Feature Store

  • Aula 1 • Eliminar a Divergência entre Treino e Serviço

    Aborda a consistência entre dados de treino offline e caraterísticas de serviço online. Os formandos implementam conjuntos de treino baseados em consultas que espelham os caminhos de inferência de produção.

  • Aula 2 • Arquitetura do Databricks Feature Store

    Explica as tabelas do Feature Store, metadados e a divisão offline-online. Os formandos compreendem como as caraterísticas são armazenadas, versionadas e recuperadas para treino e serviço.

  • Aula 3 • Escrita e Leitura de Tabelas de Caraterísticas

    Ensina as APIs de escrita e leitura para atualizações de caraterísticas em lote e em fluxo. Liga os pipelines de ingestão do Capítulo 2 aos fluxos de trabalho de treino de modelos posteriores.

  • Aula 4 • Fundamentos de Engenharia de Caraterísticas

    Abrange codificação, escalamento, imputação e termos de interação utilizando Spark. Estabelece o vocabulário de caraterísticas aplicado ao longo dos capítulos de Feature Store e treino de modelos.

  • Aula 5 • Governação e Reutilização de Caraterísticas

    Abrange descoberta de caraterísticas, controlo de acesso e partilha entre equipas através do Unity Catalog. Reduz o esforço duplicado de engenharia e aplica a linhagem de dados em projetos de ML.

Capítulo 4Ver detalhes

Treino de Modelos com MLflow

  • Aula 1 • Treino de Modelos de Aprendizagem Profunda

    Apresenta ciclos de treino do TensorFlow e PyTorch integrados com o registo do MLflow. Prepara os formandos para a aprendizagem profunda distribuída abordada no capítulo de treino avançado.

  • Aula 2 • Ajuste de Hiperparâmetros com Hyperopt

    Ensina otimização bayesiana e pesquisa paralela utilizando Hyperopt e SparkTrials. Os formandos melhoram o desempenho dos modelos de forma sistemática para além da pesquisa manual em grelha.

  • Aula 3 • Fundamentos de Registo com MLflow

    Apresenta experiências, execuções, parâmetros, métricas e etiquetas no MLflow. Estabelece a disciplina de registo que suporta o ML reprodutível ao longo de todo o curso.

  • Aula 4 • Treino de Modelos Scikit-learn e Spark ML

    Abrange construção de pipelines, validação cruzada e registo automático do MLflow para ambos os frameworks. Os formandos treinam e registam modelos de base que servem como referência para técnicas avançadas.

  • Aula 5 • Projetos MLflow e Reprodutibilidade

    Abrange projetos MLflow, pontos de entrada e especificações de ambiente para treino portátil. Permite que as equipas reproduzam qualquer execução experimental em qualquer cluster compatível.

Capítulo 5Ver detalhes

Registo de Modelos e Gestão do Ciclo de Vida

  • Aula 1 • Registo e Versionamento de Modelos

    Ensina o registo programático e através da interface de utilizador de modelos a partir de execuções do MLflow. Os formandos estabelecem uma disciplina de versionamento consistente para todos os modelos treinados.

  • Aula 2 • Transições de Estágio e Fluxos de Trabalho de Aprovação

    Abrange as transições de Staging, Production e Archived com notificações baseadas em webhooks. Implementa um processo de promoção controlado que espelha as normas empresariais de MLOps.

  • Aula 3 • Registo de Modelos Unity Catalog

    Explica o Registo de Modelos apoiado pelo Unity Catalog para governação entre espaços de trabalho. Os formandos migram da gestão de modelos ao nível do espaço de trabalho para a gestão ao nível do catálogo para escala empresarial.

  • Aula 4 • Assinaturas de Modelos e Exemplos de Entrada

    Apresenta assinaturas de modelos do MLflow, exemplos de entrada e aplicação de esquemas. Previne erros de tipo em tempo de execução e documenta as interfaces esperadas do modelo para consumidores posteriores.

  • Aula 5 • Visão Geral do Registo de Modelos do MLflow

    Explica modelos registados, versões, estágios e aliases no Registo de Modelos. Liga as execuções experimentais do Capítulo 4 a um pipeline de promoção governado.

Capítulo 6Ver detalhes

Treino de Modelos Escalável e Distribuído

  • Aula 1 • Ajuste de Hiperparâmetros Distribuído à Escala

    Estende o Hyperopt SparkTrials e introduz o Optuna para pesquisa paralela em grande escala. Os formandos ajustam modelos de aprendizagem profunda em centenas de experiências concorrentes de forma eficiente.

  • Aula 2 • TorchDistributor para Treino PyTorch

    Apresenta o TorchDistributor como a API nativa do Databricks para PyTorch distribuído. Os formandos lançam tarefas PyTorch multi-GPU e multi-nó sem configuração manual do cluster.

  • Aula 3 • Conceitos de Treino Distribuído

    Abrange paralelismo de dados, paralelismo de modelos e estratégias de sincronização de gradientes. Fornece a base teórica necessária antes de implementar frameworks distribuídos.

  • Aula 4 • Horovod para Aprendizagem Profunda Distribuída

    Ensina a inicialização do Horovod, fragmentação de dados por classificação e HorovodRunner no Databricks. Os formandos convertem scripts de treino de nó único em tarefas distribuídas multi-nó.

  • Aula 5 • Pandas UDFs para Inferência Distribuída

    Abrange UDFs Pandas escalares, de mapa agrupado e iteradoras para aplicar modelos à escala do Spark. Permite inferência em lote em milhares de milhões de linhas sem mover dados do cluster.

Capítulo 7Ver detalhes

Implementação de Modelos e Serviço em Tempo Real

  • Aula 1 • Arquitetura de Model Serving do Databricks

    Explica o serviço de modelos sem servidor, tipos de endpoint e encaminhamento de tráfego. Orienta os formandos para a camada de serviço antes de configurar e testar endpoints ativos.

  • Aula 2 • Alvos de Implementação Externa

    Abrange a exportação de modelos para ONNX, contentores Docker e plataformas de serviço nativas da cloud. Prepara os formandos para implementar modelos treinados no Databricks fora do ambiente Databricks.

  • Aula 3 • Lógica de Inferência Personalizada com PyFunc

    Ensina o sabor PyFunc do MLflow para encapsular lógica Python arbitrária como um modelo implementável. Os formandos adicionam pré-processamento, pós-processamento e lógica de ensemble aos endpoints de serviço.

  • Aula 4 • Implementação de Modelos MLflow em Endpoints

    Abrange criação de endpoints, fixação de versões de modelos e invocação da API REST. Os formandos implementam modelos registados do Capítulo 5 e validam as respostas de ponta a ponta.

  • Aula 5 • Pipelines de Inferência em Lote

    Implementa classificação em lote programada utilizando Databricks Jobs e mlflow.pyfunc.spark_udf. Complementa o serviço em tempo real para casos de uso tolerantes à latência e de alto débito.

Capítulo 8Ver detalhes

MLOps, Monitorização e Governação de Produção

  • Aula 1 • Auditoria, Linhagem e Conformidade

    Abrange linhagem do Unity Catalog, registos de auditoria do MLflow e governação de acesso para ambientes regulamentados. Os formandos documentam a proveniência dos modelos para satisfazer requisitos de auditoria internos e externos.

  • Aula 2 • Monitorização do Lakehouse para ML

    Apresenta o Lakehouse Monitoring do Databricks para cálculo automatizado de métricas em tabelas de inferência. Fornece painéis prontos a usar para qualidade do modelo e saúde dos dados.

  • Aula 3 • Princípios de MLOps e Níveis de Maturidade

    Define a maturidade do MLOps desde a experimentação manual até pipelines totalmente automatizados. Enquadra os objetivos de governação e automatização que os formandos implementam nas secções seguintes.

  • Aula 4 • Deteção de Deriva de Dados e Modelos

    Abrange testes estatísticos para mudança de covariáveis, deriva de rótulos e deriva de previsões. Os formandos implementam alertas de deriva que acionam pipelines de retreino automaticamente.

  • Aula 5 • Pipelines de Retreino Automatizado

    Constrói fluxos de trabalho de retreino baseados em acionadores e programados utilizando Databricks Jobs e Delta Live Tables. Mantém os modelos de produção atualizados sem intervenção manual.

Certificação

Seu certificado válido de conclusão

Este curso é para si:

  • Cientistas de dados prontos para ir além dos notebooks locais e avançar para ML à escala da nuvem.

  • Engenheiros de aprendizagem automática que procuram fluxos de trabalho estruturados para implementar e monitorizar modelos.

  • Engenheiros de software em transição para funções de aprendizagem automática em plataformas de nuvem.

  • Engenheiros de análise que desejam alargar os seus pipelines de dados à formação de modelos.

  • Licenciados que aplicam conhecimentos académicos de aprendizagem automática em ambientes empresariais reais.

  • Programadores de BI curiosos por criar sistemas preditivos com base nos seus dados.

O que os nossos alunos dizem

As vossas aulas são perfeitas. Adquiri o pacote de um ano e, finalmente, tenho a oportunidade de acompanhar diversos temas do meu interesse sem precisar de mudar de plataforma... agradeço por tudo o que fazem, já vos recomendei a outras pessoas...
Giulio Carlo
Giulio CarloAluno de Marketing Digital
Gosto de como as lições são directas ao assunto e como consigo alterar capítulos e saltar conteúdos de que não preciso.
Mariana Ferres
Mariana FerresAluna de Fotografia
Gosto do conteúdo e do modo de apresentação e transcrição de vídeos, o que acelera o processo!
Luciana Alvarenga
Luciana AlvarengaAluna de Design de Unhas
A plataforma é rápida, simples de usar. A diversidade de conteúdo e os vídeos complementares ajudam muito na aprendizagem.
André Felipe
André FelipeAluno de Engenharia de Prompt

Principais formações

FAQ

Quem é a Dedika?

O certificado é válido em Portugal?

Os cursos são gratuitos?

Qual é a carga horária dos cursos?

Como são os cursos?

Como funcionam os cursos?

Qual é a duração dos cursos?

Qual é o custo ou preço dos cursos?

O que é um curso EAD ou online e como funciona?

Curso em PDF