Scegli la tua lingua
Formazione Databricks
Più di 2 milioni di studenti in tutto il mondo

Formazione Databricks

Padroneggia la piattaforma Databricks dalle fondamenta, coprendo l'architettura lakehouse, Apache Spark, Delta Lake e i flussi di lavoro ML. Questa formazione fornisce a data engineer, analisti e data scientist le competenze pratiche necessarie per costruire pipeline e soluzioni di analytics di livello produttivo. Se lavori con dati su larga scala, questa è la formazione che farà avanzare la tua carriera.

Dedika per aziende

Cosa imparerai:

Questo corso copre ogni livello principale della piattaforma Databricks, a partire dall'architettura lakehouse e dai fondamenti del workspace. Scriverai e ottimizzerai job Apache Spark, gestirai tabelle Delta Lake e costruirai pipeline ETL affidabili utilizzando Auto Loader e Delta Live Tables. Applicherai l'architettura medallion per organizzare i dati in livelli Bronze, Silver e Gold. Il corso copre anche Databricks SQL per l'analisi, MLflow per la gestione del ciclo di vita del machine learning e l'orchestrazione dei flussi di lavoro per i deployment in produzione. Gli argomenti avanzati includono l'ottimizzazione delle prestazioni di Spark, la governance con Unity Catalog, lo streaming in tempo reale con Kafka e l'AI generativa con Mosaic AI.

Come studi in modo pratico Formazione Databricks

Come metti in pratica Formazione Databricks

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 40 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Introduzione a Databricks e al Lakehouse

  • Lezione 1 • Navigare nell'area di lavoro di Databricks

    Illustra l'interfaccia utente dell'area di lavoro, l'organizzazione delle risorse e i ruoli utente. I partecipanti acquisiscono familiarità pratica con l'ambiente prima di scrivere qualsiasi codice.

  • Lezione 2 • Connessione alle sorgenti dati

    Dimostra come montare l'archiviazione cloud e connettersi a database esterni. Stabilisce i modelli di accesso ai dati necessari per tutte le attività di data engineering e analytics.

  • Lezione 3 • Cos'è l'architettura Lakehouse

    Definisce il paradigma lakehouse e lo contrappone ai data warehouse e ai data lake. Stabilisce il contesto architetturale per tutto il lavoro successivo con Databricks.

  • Lezione 4 • Lavorare con i notebook di Databricks

    Introduce la creazione di notebook, i comandi magici e il supporto multi-linguaggio. I notebook sono l'interfaccia di sviluppo principale utilizzata in tutti i capitoli successivi.

  • Lezione 5 • Cluster: configurazione e gestione

    Spiega i tipi di cluster, le opzioni di configurazione e la gestione del ciclo di vita. Una corretta configurazione del cluster è essenziale per un uso efficiente delle risorse durante tutto il corso.

Capitolo 2Vedi dettagli

Fondamenti di Apache Spark in Databricks

  • Lezione 1 • Lettura e scrittura di formati di dati

    Illustra la lettura e la scrittura dei formati Parquet, JSON, CSV e Delta con le relative opzioni. Una corretta gestione dei formati è fondamentale per tutte le pipeline di ingestione e output.

  • Lezione 2 • DataFrame e l'API DataFrame

    Illustra la creazione di DataFrame, l'inferenza dello schema e le trasformazioni principali. I DataFrame sono l'astrazione primaria utilizzata in tutti i capitoli sull'elaborazione dei dati.

  • Lezione 3 • Basi delle prestazioni di Spark

    Introduce il partizionamento, la caching e i broadcast join per l'ottimizzazione delle prestazioni. Queste tecniche vengono applicate nei capitoli avanzati sull'ottimizzazione più avanti nel corso.

  • Lezione 4 • Architettura e modello di esecuzione di Spark

    Spiega driver, executor, DAG e lazy evaluation. Comprendere il flusso di esecuzione è fondamentale per scrivere codice Spark efficiente nei capitoli successivi.

  • Lezione 5 • Spark SQL per l'interrogazione dei dati

    Insegna l'interrogazione basata su SQL in Spark utilizzando viste temporanee e tabelle del catalogo. Collega le competenze SQL con il motore di esecuzione di Spark.

Capitolo 3Vedi dettagli

Delta Lake: archiviazione dati affidabile

  • Lezione 1 • Operazioni DML su tabelle Delta

    Insegna le operazioni INSERT, UPDATE, DELETE e MERGE sulle tabelle Delta. Consente ai partecipanti di implementare pattern di upsert essenziali per le pipeline di dati incrementali.

  • Lezione 2 • Ottimizzare le tabelle Delta

    Illustra i comandi OPTIMIZE, ZORDER e VACUUM per la gestione delle prestazioni e dell'archiviazione. Queste operazioni sono fondamentali per mantenere tabelle Delta di livello produttivo.

  • Lezione 3 • Time Travel e versionamento dei dati

    Dimostra come interrogare versioni storiche delle tabelle e ripristinare stati precedenti. Il time travel supporta l'auditing e il ripristino degli errori nelle pipeline di dati in produzione.

  • Lezione 4 • Creare e gestire tabelle Delta

    Illustra le operazioni DDL, le proprietà delle tabelle e le tabelle gestite rispetto a quelle esterne. Queste competenze sono necessarie per costruire livelli di dati strutturati nei capitoli successivi sulle pipeline.

  • Lezione 5 • Concetti fondamentali di Delta Lake

    Spiega il log delle transazioni Delta, le garanzie ACID e come Delta differisce dal semplice Parquet. Fornisce le basi concettuali per tutte le operazioni sulle tabelle Delta.

Capitolo 4Vedi dettagli

Ingestione dei dati e pipeline ETL

  • Lezione 1 • Auto Loader per l'ingestione incrementale

    Introduce le modalità di notifica dei file e di elenco delle directory di Auto Loader per un'ingestione scalabile. Auto Loader è il pattern Databricks consigliato per l'ingestione continua basata su file.

  • Lezione 2 • Pattern di ingestione batch

    Illustra le strategie di caricamento batch completo e incrementale utilizzando Spark e Delta. Stabilisce i pattern di ingestione che sono alla base di tutte le architetture di pipeline in questo capitolo.

  • Lezione 3 • Costruire la logica di trasformazione

    Illustra i pattern di trasformazione multi-step, tra cui pulizia, arricchimento e deduplicazione. La logica di trasformazione è il livello di valore aggiunto principale in qualsiasi pipeline ETL.

  • Lezione 4 • Delta Live Tables per l'orchestrazione delle pipeline

    Introduce Delta Live Tables (DLT) per la definizione dichiarativa delle pipeline e l'applicazione della qualità. DLT semplifica la gestione delle pipeline e si integra con l'architettura medaglione.

  • Lezione 5 • Fondamenti di Structured Streaming

    Insegna il micro-batch e lo streaming continuo con Spark Structured Streaming. Fornisce le basi per lo streaming necessarie per le sezioni successive sulle pipeline in tempo reale.

Capitolo 5Vedi dettagli

Modellazione dei dati e architettura Medaglione

  • Lezione 1 • Principi dell'architettura Medaglione

    Definisce le responsabilità dei livelli Bronze, Silver e Gold e i contratti di dati. Fornisce il quadro strutturale applicato in ogni sezione successiva di modellazione e pipeline.

  • Lezione 2 • Progettare il livello Bronze

    Illustra l'atterraggio dei dati grezzi, lo schema-on-read e la preservazione della fedeltà alla sorgente. Un livello Bronze ben progettato garantisce la piena verificabilità e la capacità di rielaborazione.

  • Lezione 3 • Costruire gli aggregati del livello Gold

    Illustra la costruzione di tabelle pre-aggregate e denormalizzate ottimizzate per BI e reportistica. Le tabelle Gold riducono la complessità delle query e migliorano le prestazioni dei dashboard.

  • Lezione 4 • Costruire il livello Silver

    Insegna la pulizia, il cast dei tipi, la deduplicazione e la conformazione dei dati a uno schema unificato. Il livello Silver è la sorgente primaria per i carichi di lavoro analitici e di ML.

  • Lezione 5 • Qualità dei dati e aspettative

    Introduce l'applicazione di vincoli, i pattern di quarantena e il monitoraggio delle metriche di qualità. Incorporare controlli di qualità a ogni livello impedisce che i dati errati si propaghino a valle.

Capitolo 6Vedi dettagli

Databricks SQL e Analytics

  • Lezione 1 • Ottimizzazione delle query per l'analisi

    Insegna l'analisi dei piani di query, le strategie di caching e il caching dei risultati per i carichi di lavoro SQL. Query ottimizzate riducono i costi del warehouse e migliorano l'esperienza utente.

  • Lezione 2 • Creare dashboard e visualizzazioni

    Illustra la creazione di grafici, dashboard e avvisi all'interno di Databricks SQL. I dashboard consentono agli stakeholder aziendali di fruire dei dati senza scrivere codice.

  • Lezione 3 • Unity Catalog per la governance dei dati

    Introduce lo spazio dei nomi a tre livelli, il controllo degli accessi e la tracciabilità dei dati di Unity Catalog. La governance è fondamentale per un'analisi sicura e conforme tra i team.

  • Lezione 4 • Tecniche SQL avanzate in Databricks

    Insegna le funzioni finestra, le CTE e le funzioni di ordine superiore per query analitiche complesse. Queste tecniche consentono analisi sofisticate direttamente all'interno di Databricks SQL.

  • Lezione 5 • SQL Warehouse ed esecuzione delle query

    Illustra i tipi di SQL warehouse, il dimensionamento e il routing delle query. Una corretta configurazione del warehouse incide direttamente sulle prestazioni delle query e sui costi per i carichi di lavoro analitici.

Capitolo 7Vedi dettagli

Machine Learning con Databricks e MLflow

  • Lezione 1 • Registro modelli di MLflow

    Introduce la registrazione dei modelli, le transizioni di fase e la gestione delle versioni nel Model Registry. Il registro fornisce governance e tracciabilità per i modelli in produzione.

  • Lezione 2 • Pubblicazione del modello e inferenza batch

    Illustra gli endpoint per la pubblicazione di modelli in tempo reale e l'inferenza batch con Spark. Distribuire i modelli in entrambe le modalità garantisce flessibilità per diverse esigenze aziendali.

  • Lezione 3 • Addestrare modelli su larga scala con Spark

    Illustra l'addestramento distribuito utilizzando pandas UDF, Spark ML e Hyperopt per l'ottimizzazione. L'addestramento distribuito riduce il tempo per ottenere insight su grandi set di dati.

  • Lezione 4 • Monitoraggio degli esperimenti con MLflow

    Insegna a registrare parametri, metriche e artefatti con MLflow Tracking. Il monitoraggio sistematico degli esperimenti consente la riproducibilità e una selezione informata dei modelli.

  • Lezione 5 • Databricks ML Runtime e Feature Engineering

    Illustra l'ambiente ML Runtime, le librerie preinstallate e le basi del Feature Store. Un set di feature ben preparato è il fondamento per un addestramento del modello riproducibile.

Capitolo 8Vedi dettagli

Orchestrazione dei flussi di lavoro e deployment in produzione

  • Lezione 1 • Monitoraggio, logging e gestione dei costi

    Illustra i log degli eventi del cluster, le metriche dei job, i log di audit e il monitoraggio dei costi in DBU. L'osservabilità e il controllo dei costi sono essenziali per operazioni di produzione sostenibili.

  • Lezione 2 • Pianificazione e attivazione dei flussi di lavoro

    Insegna la pianificazione basata su cron, gli attivatori all'arrivo di file e gli attivatori API esterni. L'attivazione flessibile garantisce che le pipeline vengano eseguite al momento giusto con un intervento manuale minimo.

  • Lezione 3 • Infrastructure as Code con Terraform

    Introduce il provisioning delle risorse Databricks utilizzando il provider Terraform. L'infrastructure as code garantisce una configurazione dell'ambiente riproducibile e verificabile tra le aree di lavoro.

  • Lezione 4 • Job Databricks e orchestrazione dei task

    Illustra la creazione di job multi-task, l'impostazione delle dipendenze e la configurazione del calcolo per ogni task. I job sono il meccanismo principale per eseguire carichi di lavoro di produzione secondo una pianificazione.

  • Lezione 5 • CI/CD per Databricks con Repos

    Illustra l'integrazione con Git tramite Databricks Repos, le strategie di branching e il deployment automatizzato. Le pratiche CI/CD riducono il rischio di deployment e accelerano la distribuzione dei prodotti dati.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Data Engineer: pronto a superare le pipeline di base per passare a una piattaforma lakehouse unificata.

  • Data Analyst: desidera interrogare e visualizzare dati su larga scala utilizzando Databricks SQL.

  • Data Scientist: necessita di una piattaforma affidabile per il feature engineering e il deployment dei modelli.

  • Analytics Engineer: sta costruendo livelli di trasformazione in stile dbt ed esplorando alternative native Spark.

  • Cloud Engineer: supporta i team dati e necessita di una conoscenza più approfondita dell'infrastruttura Databricks.

  • Cambio di carriera: transizione dallo sviluppo software al moderno data engineering.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF