Scegli la tua lingua
Corso Big Data Integration
Più di 2 milioni di studenti in tutto il mondo

Corso Big Data Integration

Padroneggi ogni livello dell'integrazione moderna dei big data, dall'ingestion e archiviazione fino alle pipeline di streaming e alla governance. Questo corso fornisce a ingegneri e architetti dei dati la profondità tecnica per costruire sistemi di livello produttivo in grado di gestire dati massivi e complessi su larga scala. Sia che progetti pipeline cloud-native o applichi policy di conformità, acquisirà competenze che si traducono direttamente in un impatto concreto nel mondo reale.

Dedika per aziende

Cosa imparerai:

Imparerà a progettare e realizzare pipeline di dati batch e in tempo reale utilizzando pattern architetturali standard del settore, tra cui ETL, ELT e integrazione guidata dagli eventi. Il corso copre i sistemi di archiviazione dei dati come data lake, data warehouse e paradigmi NoSQL, insieme alle best practice per la gestione degli schemi e la modellazione dei dati. Acquisirà conoscenze pratiche sui framework di qualità dei dati, sull'orchestrazione delle pipeline e sulle tecniche di osservabilità utilizzate negli ambienti di produzione. Tra gli argomenti avanzati figurano le piattaforme di integrazione cloud-native, l'ingestion basata su API, l'integrazione delle pipeline di machine learning e l'architettura a data mesh. Al termine, sarà in grado di costruire, monitorare e governare sistemi di integrazione dei dati su scala aziendale.

Come studi in modo pratico Corso Big Data Integration

Come metti in pratica Corso Big Data Integration

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 39 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Fondamenti di integrazione dei big data

  • Lezione 1 • Metadati e cataloghi di dati

    Spiega i ruoli dei metadati tecnici, di business e operativi. Stabilisce la gestione dei metadati come preoccupazione trasversale per tutto il lavoro di integrazione.

  • Lezione 2 • Panoramica del panorama dei big data

    Definisce le caratteristiche dei big data e lo spazio problematico dell'integrazione. Ancora i successivi argomenti tecnici in un contesto di business reale.

  • Lezione 3 • Stili architetturali di integrazione dei dati

    Esamina pattern ETL, ELT, di virtualizzazione dei dati e guidati dagli eventi. Fornisce un framework decisionale utilizzato in tutto il corso.

  • Lezione 4 • Fonti di dati e basi dell'ingestione

    Cataloga i tipi comuni di fonti e i meccanismi di ingestione. Prepara gli studenti a progettare livelli di ingestione nei capitoli successivi.

Capitolo 2Vedi dettagli

Sistemi di archiviazione dati per l'integrazione

  • Lezione 1 • File system distribuiti

    Copre i principi di archiviazione distribuita a livello di blocco e la semantica del file system. Collega l'architettura di archiviazione alle decisioni di ingestione ed elaborazione prese in seguito.

  • Lezione 2 • Selezione del formato di archiviazione

    Confronta formati basati su righe, colonnari e annidati per carichi di lavoro di integrazione. Informa direttamente le decisioni di progettazione dello schema e trasformazione successive.

  • Lezione 3 • Object storage e tier cloud

    Spiega la semantica dell'object storage e il tiering cloud-native. Prepara gli studenti per architetture di integrazione cloud-based nei capitoli successivi.

  • Lezione 4 • Data warehouse e data lake

    Contrasta i warehouse schema-on-write con i lake schema-on-read. Guida la selezione dello storage in base ai pattern di query e ai requisiti di integrazione.

  • Lezione 5 • Paradigmi di storage NoSQL

    Esamina archivi chiave-valore, a documenti, a famiglie di colonne e a grafo. Allinea ogni paradigma con i casi d'uso di integrazione introdotti nel Capitolo 1.

Capitolo 3Vedi dettagli

Ingestione batch e pipeline ETL

  • Lezione 1 • Fondamenti di trasformazione dei dati

    Copre le trasformazioni di filtraggio, aggregazione, join e arricchimento. Costruisce l'insieme di competenze di trasformazione esteso nei capitoli avanzati.

  • Lezione 2 • Caricamento dati e pattern di destinazione

    Spiega le strategie di caricamento upsert, merge e a dimensione a modifica lenta. Collega la logica di caricamento all'archiviazione in warehouse e lake trattata nel Capitolo 2.

  • Lezione 3 • Pattern di progettazione dell'ingestione batch

    Copre le strategie di ingestione a caricamento completo, incrementale e change-data-capture. Stabilisce il livello di ingestione che alimenta tutto il successivo lavoro di trasformazione.

  • Lezione 4 • Tecniche di estrazione dei dati

    Insegna l'estrazione su larga scala da database relazionali, file e API. Fornisce pattern di estrazione riutilizzabili applicati nei laboratori sulle pipeline.

  • Lezione 5 • Basi di orchestrazione delle pipeline

    Introduce l'orchestrazione del flusso di lavoro basata su DAG per pipeline batch. Prepara gli studenti per l'orchestrazione e il monitoraggio avanzati nei capitoli successivi.

Capitolo 4Vedi dettagli

Integrazione in tempo reale e streaming

  • Lezione 1 • Elaborazione di flussi stateful e stateless

    Insegna filtraggio, mappatura, finestratura e aggregazione su flussi live. Costruisce la logica di elaborazione che alimenta dashboard in tempo reale e sistemi a valle.

  • Lezione 2 • Concetti di streaming e sistemi di messaggistica

    Definisce flussi di eventi, topic, partizioni e gruppi di consumatori. Stabilisce le basi di messaggistica per tutto il lavoro sulle pipeline di streaming.

  • Lezione 3 • Architetture Lambda e Kappa

    Contrasta architetture di integrazione batch-più-streaming e solo-streaming. Guida le decisioni architetturali per carichi di lavoro ibridi incontrati nella pratica.

  • Lezione 4 • Consegna flusso-a-storage

    Spiega connettori sink, atterraggio micro-batch e strategie di compattazione. Collega l'output dello streaming ai sistemi di archiviazione trattati nel Capitolo 2.

  • Lezione 5 • Pattern di ingestione in streaming

    Copre connettori sorgente, schema registry e serializzazione per l'ingestione in streaming. Estende i pattern di ingestione batch del Capitolo 3 a flussi di dati continui.

Capitolo 5Vedi dettagli

Gestione dello schema e modellazione dei dati

  • Lezione 1 • Gestione dei dati master e di riferimento

    Definisce domini di dati master, golden record e governance dei dati di riferimento. Fornisce le basi di consistenza dei dati per scenari di integrazione multi-fonte.

  • Lezione 2 • Progettazione dello schema per data lake

    Spiega schema-on-read, architettura a zone e convenzioni di cartelle per i lake. Estende i concetti di storage lake del Capitolo 2 con una guida pratica alla progettazione.

  • Lezione 3 • Modellazione concettuale e logica dei dati

    Copre la modellazione entità-relazione e la normalizzazione per contesti di integrazione. Fornisce le basi di modellazione per la progettazione dello schema fisico successiva.

  • Lezione 4 • Evoluzione dello schema e compatibilità

    Copre strategie di compatibilità backward, forward e completa per schemi in evoluzione. Previene i guasti della pipeline causati dalla deriva dello schema nei sistemi di produzione.

  • Lezione 5 • Modellazione dimensionale per l'analisi

    Insegna schemi a stella e fiocco di neve, tabelle dei fatti e gerarchie dimensionali. Supporta direttamente i pattern di caricamento del warehouse introdotti nel Capitolo 3.

Capitolo 6Vedi dettagli

Qualità dei dati e pulizia nelle pipeline

  • Lezione 1 • Regole di qualità e framework di convalida

    Spiega la convalida basata su regole, le suite di aspettative e i pattern di quarantena. Integra i quality gate nelle pipeline batch e di streaming costruite in precedenza.

  • Lezione 2 • Monitoraggio della qualità dei dati e SLA

    Copre il monitoraggio continuo della qualità, l'alerting e il tracciamento degli accordi sul livello di servizio. Collega le metriche di qualità a dashboard operative e processi di governance.

  • Lezione 3 • Profilazione e rilevamento delle anomalie

    Copre la profilazione statistica, l'analisi dei pattern e le tecniche di rilevamento degli outlier. Fornisce strumenti diagnostici utilizzati prima e durante l'esecuzione della pipeline.

  • Lezione 4 • Tecniche di pulizia dei dati

    Insegna standardizzazione, deduplicazione, imputazione e trasformazioni di parsing. Estende le competenze di trasformazione del Capitolo 3 con logica focalizzata sulla qualità.

  • Lezione 5 • Dimensioni e metriche della qualità dei dati

    Definisce le metriche di completezza, accuratezza, consistenza, tempestività e unicità. Stabilisce obiettivi di qualità misurabili applicati in tutta la progettazione della pipeline.

Capitolo 7Vedi dettagli

Orchestrazione e monitoraggio delle pipeline

  • Lezione 1 • Osservabilità e logging della pipeline

    Insegna logging strutturato, tracciamento distribuito e raccolta di metriche per le pipeline. Fornisce la visibilità necessaria per diagnosticare i guasti in flussi di integrazione complessi.

  • Lezione 2 • Orchestrazione avanzata del flusso di lavoro

    Copre DAG dinamici, dipendenze tra pipeline e scheduling basato su SLA. Estende l'orchestrazione di base del Capitolo 3 a flussi di lavoro su scala enterprise.

  • Lezione 3 • Testing della pipeline e CI/CD

    Spiega strategie di testing unitario, di integrazione ed end-to-end per le pipeline di dati. Incorpora la garanzia di qualità nel ciclo di vita del deployment del codice di integrazione.

  • Lezione 4 • Ottimizzazione delle prestazioni e pianificazione della capacità

    Copre l'identificazione dei colli di bottiglia, il dimensionamento delle risorse e le strategie di scalabilità per le pipeline. Assicura che i sistemi di integrazione soddisfino gli SLA di throughput e latenza sotto carico.

  • Lezione 5 • Alerting e risposta agli incidenti

    Copre l'alerting basato su soglia e anomalie, i runbook di reperibilità e i postmortem. Collega i dati di monitoraggio a risposte operative attuabili.

Capitolo 8Vedi dettagli

Governance, sicurezza e conformità nell'integrazione

  • Lezione 1 • Conformità normativa e audit trail

    Spiega la retention dei dati, il diritto alla cancellazione, la gestione del consenso e il logging di audit. Allinea le pipeline di integrazione con gli obblighi di protezione dei dati intersettoriali.

  • Lezione 2 • Controllo degli accessi e gestione delle identità

    Copre il controllo degli accessi basato su ruoli e attributi per le piattaforme di dati. Protegge le risorse di dati attraverso i livelli di storage e pipeline costruiti nei capitoli precedenti.

  • Lezione 3 • Crittografia e trasporto sicuro dei dati

    Copre la crittografia a riposo, in transito e la gestione delle chiavi per i sistemi di integrazione. Protegge i dati in tutte le operazioni di movimento e archiviazione nella pipeline.

  • Lezione 4 • Framework di governance dei dati per l'integrazione

    Definisce ruoli di governance, politiche e modelli di stewardship per risorse di dati integrate. Fornisce la struttura organizzativa che supporta tutti i controlli tecnici di governance.

  • Lezione 5 • Privacy dei dati e anonimizzazione

    Insegna tecniche di mascheramento, tokenizzazione, pseudonimizzazione e privacy differenziale. Consente la gestione conforme dei dati sensibili nelle pipeline di integrazione.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Ingegnere dei dati: pronto a superare il lavoro su singole pipeline per affrontare la progettazione di sistemi completi.

  • Ingegnere analitico: desidera una conoscenza più approfondita dell'infrastruttura alla base dei modelli di dati che realizza.

  • Ingegnere del software: in transizione verso ruoli backend incentrati sui dati che richiedono competenze sulle pipeline.

  • Architetto dei dati: cerca un aggiornamento strutturato sui pattern e sugli strumenti di integrazione moderni.

  • Sviluppatore BI: intende espandere le proprie competenze a monte, verso le pipeline che alimentano i propri report.

  • Project manager tecnico: supervisiona team di dati e necessita di padronanza dei concetti di integrazione.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF