Scegli la tua lingua
Corso pratico di Databricks ML
Più di 2 milioni di studenti in tutto il mondo

Corso pratico di Databricks ML

Padroneggiare il machine learning end-to-end sulla Databricks Lakehouse Platform — dall'ingestione dei dati e dall'ingegneria delle feature all'addestramento distribuito, al model serving e agli MLOps in produzione. Questo corso pratico fornisce a data scientist e ML engineer gli strumenti, i flussi di lavoro e le pratiche di governance che alimentano i sistemi di IA aziendali reali.

Dedika per aziende

Cosa imparerai:

  • Configurare i cluster Databricks, le integrazioni dello storage e Unity Catalog per flussi di lavoro ML sicuri.

  • Creare pipeline Delta Lake scalabili che forniscono dati puliti e versionati, pronti per l'addestramento dei modelli.

  • Progettare e governare tabelle di feature riutilizzabili utilizzando Databricks Feature Store per eliminare il training-serving skew.

  • Tracciare, registrare e promuovere i modelli attraverso un ciclo di vita MLflow governato, dall'esperimento alla produzione.

  • Distribuire endpoint di inferenza in tempo reale e batch con logica PyFunc personalizzata e monitoraggio automatizzato.

  • Implementare pipeline CI/CD, rilevamento del drift e riaddestramento automatizzato per gestire in modo affidabile i sistemi ML in produzione.

Come studi in modo pratico Corso pratico di Databricks ML

Come metti in pratica Corso pratico di Databricks ML

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 40 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Fondamenti della Piattaforma Databricks

  • Lezione 1 • Notebook e Sviluppo Collaborativo

    Introduce la creazione di notebook, i comandi magici e le funzionalità di co-authoring. Stabilisce abitudini di sviluppo riproducibili utilizzate in tutti gli esperimenti di ML successivi.

  • Lezione 2 • Architettura dell'Area di Lavoro e Navigazione

    Tratta il piano di controllo, il piano dati e l'interfaccia utente dell'area di lavoro Databricks. Fornisce agli studenti le basi sull'ambiente che utilizzeranno in tutti i capitoli successivi.

  • Lezione 3 • Accesso ai Dati e Integrazione dello Storage

    Spiega i punti di montaggio, Unity Catalog e la gestione delle credenziali per l'archiviazione cloud. Abilita un accesso ai dati sicuro e coerente, necessario per le pipeline di ML.

  • Lezione 4 • Fondamenti di Databricks CLI e API REST

    Introduce il controllo programmatico dell'area di lavoro tramite CLI ed endpoint REST. Prepara gli studenti ad automatizzare le attività e a integrare Databricks in toolchain esterne.

  • Lezione 5 • Configurazione e Gestione dei Cluster

    Insegna i tipi di cluster, le versioni di runtime e i criteri di autoscaling. Gli studenti configurano cluster di lavoro e interattivi adatti ai carichi di lavoro di ML.

Capitolo 2Vedi dettagli

Data Engineering per Pipeline di ML

  • Lezione 1 • Delta Live Tables per l'Orchestrazione delle Pipeline

    Introduce definizioni dichiarative di pipeline, aspettative e tracciamento della lineage. Automatizza l'applicazione della qualità dei dati in più fasi prima che le feature raggiungano l'addestramento del modello.

  • Lezione 2 • Trasformazione dei Dati con Spark SQL

    Tratta aggregazioni, funzioni finestra e gestione di tipi complessi in Spark SQL. Trasforma i dati grezzi in feature strutturate utilizzate dai modelli di ML.

  • Lezione 3 • Concetti Fondamentali di Apache Spark

    Tratta RDD, DataFrame e il modello di esecuzione di Spark. Fornisce le basi computazionali per tutte le attività di elaborazione dati nei capitoli successivi di ML.

  • Lezione 4 • Delta Lake per Carichi di Lavoro di ML

    Introduce le transazioni ACID, il time travel e l'ottimizzazione delle tabelle Delta. Garantisce l'affidabilità e la riproducibilità dei dati attraverso esperimenti di ML iterativi.

  • Lezione 5 • Pattern di Ingestione dei Dati

    Insegna l'ingestione batch e in streaming da file, database e flussi di eventi. Gli studenti costruiscono pipeline affidabili dalla sorgente alla zona di atterraggio per la creazione di feature di ML.

Capitolo 3Vedi dettagli

Feature Engineering e Feature Store

  • Lezione 1 • Eliminazione del Training-Serving Skew

    Affronta la coerenza tra i dati di addestramento offline e le feature di serving online. Gli studenti implementano set di addestramento basati su lookup che rispecchiano i percorsi di inferenza in produzione.

  • Lezione 2 • Architettura del Databricks Feature Store

    Spiega le tabelle del Feature Store, i metadati e la divisione offline-online. Gli studenti comprendono come le feature vengono archiviate, versionate e recuperate per l'addestramento e il serving.

  • Lezione 3 • Scrittura e Lettura di Tabelle di Feature

    Insegna le API di scrittura e lettura per aggiornamenti di feature batch e in streaming. Collega le pipeline di ingestione del Capitolo 2 ai flussi di lavoro di addestramento del modello a valle.

  • Lezione 4 • Fondamenti di Feature Engineering

    Tratta codifica, ridimensionamento, imputazione e termini di interazione utilizzando Spark. Stabilisce il vocabolario delle feature applicato in tutti i capitoli del Feature Store e dell'addestramento dei modelli.

  • Lezione 5 • Governance e Riutilizzo delle Feature

    Tratta l'individuazione delle feature, il controllo degli accessi e la condivisione tra team tramite Unity Catalog. Riduce la duplicazione del lavoro di engineering e impone la lineage dei dati tra i progetti di ML.

Capitolo 4Vedi dettagli

Addestramento dei Modelli con MLflow

  • Lezione 1 • Addestramento di Modelli di Deep Learning

    Introduce cicli di addestramento TensorFlow e PyTorch integrati con il logging di MLflow. Prepara gli studenti al deep learning distribuito trattato nel capitolo sull'addestramento avanzato.

  • Lezione 2 • Ottimizzazione degli Iperparametri con Hyperopt

    Insegna l'ottimizzazione bayesiana e la ricerca parallela utilizzando Hyperopt e SparkTrials. Gli studenti migliorano sistematicamente le prestazioni del modello oltre la ricerca a griglia manuale.

  • Lezione 3 • Fondamenti del Tracciamento con MLflow

    Introduce esperimenti, esecuzioni, parametri, metriche e tag in MLflow. Stabilisce la disciplina di registrazione che è alla base del ML riproducibile in tutto il corso.

  • Lezione 4 • Addestramento di Modelli Scikit-learn e Spark ML

    Tratta la costruzione di pipeline, la convalida incrociata e l'autologging di MLflow per entrambi i framework. Gli studenti addestrano e registrano modelli di baseline che fungono da riferimento per le tecniche avanzate.

  • Lezione 5 • Progetti MLflow e Riproducibilità

    Tratta i progetti MLflow, i punti di ingresso e le specifiche dell'ambiente per un addestramento portabile. Consente ai team di riprodurre qualsiasi esecuzione di esperimento su qualsiasi cluster compatibile.

Capitolo 5Vedi dettagli

Registro dei Modelli e Gestione del Ciclo di Vita

  • Lezione 1 • Registrazione e Versionamento dei Modelli

    Insegna la registrazione dei modelli da esecuzioni MLflow in modo programmatico e tramite interfaccia utente. Gli studenti stabiliscono una disciplina di versionamento coerente per tutti i modelli addestrati.

  • Lezione 2 • Transizioni di Fase e Flussi di Lavoro di Approvazione

    Tratta le transizioni Staging, Produzione e Archiviato con notifiche basate su webhook. Implementa un processo di promozione controllato che rispecchia gli standard MLOps aziendali.

  • Lezione 3 • Registro dei Modelli di Unity Catalog

    Spiega il Registro dei Modelli basato su Unity Catalog per la governance tra aree di lavoro. Gli studenti migrano dalla gestione dei modelli a livello di area di lavoro a quella a livello di catalogo per una scala aziendale.

  • Lezione 4 • Firme dei Modelli ed Esempi di Input

    Introduce le firme dei modelli MLflow, gli esempi di input e l'imposizione dello schema. Previene gli errori di tipo a runtime e documenta le interfacce previste del modello per i consumatori a valle.

  • Lezione 5 • Panoramica del Registro dei Modelli di MLflow

    Spiega i modelli registrati, le versioni, le fasi e gli alias nel Registro dei Modelli. Connette le esecuzioni degli esperimenti del Capitolo 4 a una pipeline di promozione governata.

Capitolo 6Vedi dettagli

Addestramento di Modelli Scalabile e Distribuito

  • Lezione 1 • Ottimizzazione Distribuita degli Iperparametri su Larga Scala

    Estende SparkTrials di Hyperopt e introduce Optuna per la ricerca parallela su larga scala. Gli studenti ottimizzano i modelli di deep learning su centinaia di prove simultanee in modo efficiente.

  • Lezione 2 • TorchDistributor per l'Addestramento PyTorch

    Introduce TorchDistributor come API Databricks nativa per PyTorch distribuito. Gli studenti lanciano job PyTorch multi-GPU e multi-nodo senza configurazione manuale del cluster.

  • Lezione 3 • Concetti di Addestramento Distribuito

    Tratta il parallelismo dei dati, il parallelismo dei modelli e le strategie di sincronizzazione dei gradienti. Fornisce le basi teoriche necessarie prima di implementare framework distribuiti.

  • Lezione 4 • Horovod per il Deep Learning Distribuito

    Insegna l'inizializzazione di Horovod, lo sharding dei dati basato sul rank e HorovodRunner su Databricks. Gli studenti convertono script di addestramento su singolo nodo in job distribuiti multi-nodo.

  • Lezione 5 • UDF Pandas per l'Inferenza Distribuita

    Tratta UDF Pandas scalari, grouped map e iteratore per applicare modelli su scala Spark. Consente l'inferenza batch su miliardi di righe senza spostare i dati dal cluster.

Capitolo 7Vedi dettagli

Distribuzione dei Modelli e Serving in Tempo Reale

  • Lezione 1 • Architettura di Databricks Model Serving

    Spiega il model serving serverless, i tipi di endpoint e l'instradamento del traffico. Orienta gli studenti al livello di serving prima di configurare e testare endpoint live.

  • Lezione 2 • Target di Distribuzione Esterni

    Tratta l'esportazione di modelli in formato ONNX, container Docker e piattaforme di serving cloud-native. Prepara gli studenti a distribuire modelli addestrati su Databricks al di fuori dell'ambiente Databricks.

  • Lezione 3 • Logica di Inferenza Personalizzata con PyFunc

    Insegna il flavor PyFunc di MLflow per incapsulare logica Python arbitraria come modello distribuibile. Gli studenti aggiungono logica di pre-elaborazione, post-elaborazione ed ensemble agli endpoint di serving.

  • Lezione 4 • Distribuzione di Modelli MLflow su Endpoint

    Tratta la creazione di endpoint, il blocco delle versioni del modello e l'invocazione dell'API REST. Gli studenti distribuiscono i modelli registrati del Capitolo 5 e convalidano le risposte end-to-end.

  • Lezione 5 • Pipeline di Inferenza Batch

    Implementa lo scoring batch pianificato utilizzando Databricks Jobs e mlflow.pyfunc.spark_udf. Complementa il serving in tempo reale per casi d'uso ad alto throughput e tolleranti alla latenza.

Capitolo 8Vedi dettagli

MLOps, Monitoraggio e Governance della Produzione

  • Lezione 1 • Audit, Lineage e Conformità

    Tratta la lineage di Unity Catalog, i log di audit di MLflow e la governance degli accessi per ambienti regolamentati. Gli studenti documentano la provenienza del modello per soddisfare i requisiti di audit interni ed esterni.

  • Lezione 2 • Lakehouse Monitoring per ML

    Introduce Databricks Lakehouse Monitoring per il calcolo automatico delle metriche sulle tabelle di inferenza. Fornisce dashboard pronte all'uso per la qualità del modello e lo stato dei dati.

  • Lezione 3 • Principi MLOps e Livelli di Maturità

    Definisce la maturità MLOps dalla sperimentazione manuale alle pipeline completamente automatizzate. Inquadra gli obiettivi di governance e automazione che gli studenti implementano nelle sezioni successive.

  • Lezione 4 • Rilevamento del Drift dei Dati e del Modello

    Tratta test statistici per lo spostamento delle covariate, il drift delle etichette e il drift delle previsioni. Gli studenti implementano avvisi di drift che attivano automaticamente le pipeline di riaddestramento.

  • Lezione 5 • Pipeline di Riaddestramento Automatizzate

    Costruisce flussi di lavoro di riaddestramento attivati e pianificati utilizzando Databricks Jobs e Delta Live Tables. Mantiene aggiornati i modelli in produzione senza intervento manuale.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Data scientist pronti a passare dai notebook locali al ML su scala cloud.

  • Ingegneri ML alla ricerca di flussi di lavoro strutturati per la distribuzione e il monitoraggio dei modelli.

  • Ingegneri del software in transizione verso ruoli di machine learning su piattaforme cloud.

  • Ingegneri dell'analytics che desiderano estendere le proprie pipeline di dati all'addestramento dei modelli.

  • Studenti universitari che applicano le conoscenze accademiche di ML a contesti aziendali reali.

  • Sviluppatori BI interessati a costruire sistemi predittivi a partire dai propri dati.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF