
Corso Big Data Integration
Padroneggi ogni livello dell'integrazione moderna dei big data, dall'ingestion e archiviazione fino alle pipeline di streaming e alla governance. Questo corso fornisce a ingegneri e architetti dei dati la profondità tecnica per costruire sistemi di livello produttivo in grado di gestire dati massivi e complessi su larga scala. Sia che progetti pipeline cloud-native o applichi policy di conformità, acquisirà competenze che si traducono direttamente in un impatto concreto nel mondo reale.
Cosa imparerai:
Imparerà a progettare e realizzare pipeline di dati batch e in tempo reale utilizzando pattern architetturali standard del settore, tra cui ETL, ELT e integrazione guidata dagli eventi. Il corso copre i sistemi di archiviazione dei dati come data lake, data warehouse e paradigmi NoSQL, insieme alle best practice per la gestione degli schemi e la modellazione dei dati. Acquisirà conoscenze pratiche sui framework di qualità dei dati, sull'orchestrazione delle pipeline e sulle tecniche di osservabilità utilizzate negli ambienti di produzione. Tra gli argomenti avanzati figurano le piattaforme di integrazione cloud-native, l'ingestion basata su API, l'integrazione delle pipeline di machine learning e l'architettura a data mesh. Al termine, sarà in grado di costruire, monitorare e governare sistemi di integrazione dei dati su scala aziendale.
Come studi in modo pratico Corso Big Data Integration
Come metti in pratica Corso Big Data Integration
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 39 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliFondamenti di integrazione dei big data
Fondamenti di integrazione dei big data
Lezione 1 • Metadati e cataloghi di dati
Spiega i ruoli dei metadati tecnici, di business e operativi. Stabilisce la gestione dei metadati come preoccupazione trasversale per tutto il lavoro di integrazione.
Lezione 2 • Panoramica del panorama dei big data
Definisce le caratteristiche dei big data e lo spazio problematico dell'integrazione. Ancora i successivi argomenti tecnici in un contesto di business reale.
Lezione 3 • Stili architetturali di integrazione dei dati
Esamina pattern ETL, ELT, di virtualizzazione dei dati e guidati dagli eventi. Fornisce un framework decisionale utilizzato in tutto il corso.
Lezione 4 • Fonti di dati e basi dell'ingestione
Cataloga i tipi comuni di fonti e i meccanismi di ingestione. Prepara gli studenti a progettare livelli di ingestione nei capitoli successivi.
Capitolo 2NascondiNascondi dettagliVedi dettagliSistemi di archiviazione dati per l'integrazione
Sistemi di archiviazione dati per l'integrazione
Lezione 1 • File system distribuiti
Copre i principi di archiviazione distribuita a livello di blocco e la semantica del file system. Collega l'architettura di archiviazione alle decisioni di ingestione ed elaborazione prese in seguito.
Lezione 2 • Selezione del formato di archiviazione
Confronta formati basati su righe, colonnari e annidati per carichi di lavoro di integrazione. Informa direttamente le decisioni di progettazione dello schema e trasformazione successive.
Lezione 3 • Object storage e tier cloud
Spiega la semantica dell'object storage e il tiering cloud-native. Prepara gli studenti per architetture di integrazione cloud-based nei capitoli successivi.
Lezione 4 • Data warehouse e data lake
Contrasta i warehouse schema-on-write con i lake schema-on-read. Guida la selezione dello storage in base ai pattern di query e ai requisiti di integrazione.
Lezione 5 • Paradigmi di storage NoSQL
Esamina archivi chiave-valore, a documenti, a famiglie di colonne e a grafo. Allinea ogni paradigma con i casi d'uso di integrazione introdotti nel Capitolo 1.
Capitolo 3NascondiNascondi dettagliVedi dettagliIngestione batch e pipeline ETL
Ingestione batch e pipeline ETL
Lezione 1 • Fondamenti di trasformazione dei dati
Copre le trasformazioni di filtraggio, aggregazione, join e arricchimento. Costruisce l'insieme di competenze di trasformazione esteso nei capitoli avanzati.
Lezione 2 • Caricamento dati e pattern di destinazione
Spiega le strategie di caricamento upsert, merge e a dimensione a modifica lenta. Collega la logica di caricamento all'archiviazione in warehouse e lake trattata nel Capitolo 2.
Lezione 3 • Pattern di progettazione dell'ingestione batch
Copre le strategie di ingestione a caricamento completo, incrementale e change-data-capture. Stabilisce il livello di ingestione che alimenta tutto il successivo lavoro di trasformazione.
Lezione 4 • Tecniche di estrazione dei dati
Insegna l'estrazione su larga scala da database relazionali, file e API. Fornisce pattern di estrazione riutilizzabili applicati nei laboratori sulle pipeline.
Lezione 5 • Basi di orchestrazione delle pipeline
Introduce l'orchestrazione del flusso di lavoro basata su DAG per pipeline batch. Prepara gli studenti per l'orchestrazione e il monitoraggio avanzati nei capitoli successivi.
Capitolo 4NascondiNascondi dettagliVedi dettagliIntegrazione in tempo reale e streaming
Integrazione in tempo reale e streaming
Lezione 1 • Elaborazione di flussi stateful e stateless
Insegna filtraggio, mappatura, finestratura e aggregazione su flussi live. Costruisce la logica di elaborazione che alimenta dashboard in tempo reale e sistemi a valle.
Lezione 2 • Concetti di streaming e sistemi di messaggistica
Definisce flussi di eventi, topic, partizioni e gruppi di consumatori. Stabilisce le basi di messaggistica per tutto il lavoro sulle pipeline di streaming.
Lezione 3 • Architetture Lambda e Kappa
Contrasta architetture di integrazione batch-più-streaming e solo-streaming. Guida le decisioni architetturali per carichi di lavoro ibridi incontrati nella pratica.
Lezione 4 • Consegna flusso-a-storage
Spiega connettori sink, atterraggio micro-batch e strategie di compattazione. Collega l'output dello streaming ai sistemi di archiviazione trattati nel Capitolo 2.
Lezione 5 • Pattern di ingestione in streaming
Copre connettori sorgente, schema registry e serializzazione per l'ingestione in streaming. Estende i pattern di ingestione batch del Capitolo 3 a flussi di dati continui.
Capitolo 5NascondiNascondi dettagliVedi dettagliGestione dello schema e modellazione dei dati
Gestione dello schema e modellazione dei dati
Lezione 1 • Gestione dei dati master e di riferimento
Definisce domini di dati master, golden record e governance dei dati di riferimento. Fornisce le basi di consistenza dei dati per scenari di integrazione multi-fonte.
Lezione 2 • Progettazione dello schema per data lake
Spiega schema-on-read, architettura a zone e convenzioni di cartelle per i lake. Estende i concetti di storage lake del Capitolo 2 con una guida pratica alla progettazione.
Lezione 3 • Modellazione concettuale e logica dei dati
Copre la modellazione entità-relazione e la normalizzazione per contesti di integrazione. Fornisce le basi di modellazione per la progettazione dello schema fisico successiva.
Lezione 4 • Evoluzione dello schema e compatibilità
Copre strategie di compatibilità backward, forward e completa per schemi in evoluzione. Previene i guasti della pipeline causati dalla deriva dello schema nei sistemi di produzione.
Lezione 5 • Modellazione dimensionale per l'analisi
Insegna schemi a stella e fiocco di neve, tabelle dei fatti e gerarchie dimensionali. Supporta direttamente i pattern di caricamento del warehouse introdotti nel Capitolo 3.
Capitolo 6NascondiNascondi dettagliVedi dettagliQualità dei dati e pulizia nelle pipeline
Qualità dei dati e pulizia nelle pipeline
Lezione 1 • Regole di qualità e framework di convalida
Spiega la convalida basata su regole, le suite di aspettative e i pattern di quarantena. Integra i quality gate nelle pipeline batch e di streaming costruite in precedenza.
Lezione 2 • Monitoraggio della qualità dei dati e SLA
Copre il monitoraggio continuo della qualità, l'alerting e il tracciamento degli accordi sul livello di servizio. Collega le metriche di qualità a dashboard operative e processi di governance.
Lezione 3 • Profilazione e rilevamento delle anomalie
Copre la profilazione statistica, l'analisi dei pattern e le tecniche di rilevamento degli outlier. Fornisce strumenti diagnostici utilizzati prima e durante l'esecuzione della pipeline.
Lezione 4 • Tecniche di pulizia dei dati
Insegna standardizzazione, deduplicazione, imputazione e trasformazioni di parsing. Estende le competenze di trasformazione del Capitolo 3 con logica focalizzata sulla qualità.
Lezione 5 • Dimensioni e metriche della qualità dei dati
Definisce le metriche di completezza, accuratezza, consistenza, tempestività e unicità. Stabilisce obiettivi di qualità misurabili applicati in tutta la progettazione della pipeline.
Capitolo 7NascondiNascondi dettagliVedi dettagliOrchestrazione e monitoraggio delle pipeline
Orchestrazione e monitoraggio delle pipeline
Lezione 1 • Osservabilità e logging della pipeline
Insegna logging strutturato, tracciamento distribuito e raccolta di metriche per le pipeline. Fornisce la visibilità necessaria per diagnosticare i guasti in flussi di integrazione complessi.
Lezione 2 • Orchestrazione avanzata del flusso di lavoro
Copre DAG dinamici, dipendenze tra pipeline e scheduling basato su SLA. Estende l'orchestrazione di base del Capitolo 3 a flussi di lavoro su scala enterprise.
Lezione 3 • Testing della pipeline e CI/CD
Spiega strategie di testing unitario, di integrazione ed end-to-end per le pipeline di dati. Incorpora la garanzia di qualità nel ciclo di vita del deployment del codice di integrazione.
Lezione 4 • Ottimizzazione delle prestazioni e pianificazione della capacità
Copre l'identificazione dei colli di bottiglia, il dimensionamento delle risorse e le strategie di scalabilità per le pipeline. Assicura che i sistemi di integrazione soddisfino gli SLA di throughput e latenza sotto carico.
Lezione 5 • Alerting e risposta agli incidenti
Copre l'alerting basato su soglia e anomalie, i runbook di reperibilità e i postmortem. Collega i dati di monitoraggio a risposte operative attuabili.
Capitolo 8NascondiNascondi dettagliVedi dettagliGovernance, sicurezza e conformità nell'integrazione
Governance, sicurezza e conformità nell'integrazione
Lezione 1 • Conformità normativa e audit trail
Spiega la retention dei dati, il diritto alla cancellazione, la gestione del consenso e il logging di audit. Allinea le pipeline di integrazione con gli obblighi di protezione dei dati intersettoriali.
Lezione 2 • Controllo degli accessi e gestione delle identità
Copre il controllo degli accessi basato su ruoli e attributi per le piattaforme di dati. Protegge le risorse di dati attraverso i livelli di storage e pipeline costruiti nei capitoli precedenti.
Lezione 3 • Crittografia e trasporto sicuro dei dati
Copre la crittografia a riposo, in transito e la gestione delle chiavi per i sistemi di integrazione. Protegge i dati in tutte le operazioni di movimento e archiviazione nella pipeline.
Lezione 4 • Framework di governance dei dati per l'integrazione
Definisce ruoli di governance, politiche e modelli di stewardship per risorse di dati integrate. Fornisce la struttura organizzativa che supporta tutti i controlli tecnici di governance.
Lezione 5 • Privacy dei dati e anonimizzazione
Insegna tecniche di mascheramento, tokenizzazione, pseudonimizzazione e privacy differenziale. Consente la gestione conforme dei dati sensibili nelle pipeline di integrazione.
Il tuo certificato valido di completamento
Questo corso è per te:
Ingegnere dei dati: pronto a superare il lavoro su singole pipeline per affrontare la progettazione di sistemi completi.
Ingegnere analitico: desidera una conoscenza più approfondita dell'infrastruttura alla base dei modelli di dati che realizza.
Ingegnere del software: in transizione verso ruoli backend incentrati sui dati che richiedono competenze sulle pipeline.
Architetto dei dati: cerca un aggiornamento strutturato sui pattern e sugli strumenti di integrazione moderni.
Sviluppatore BI: intende espandere le proprie competenze a monte, verso le pipeline che alimentano i propri report.
Project manager tecnico: supervisiona team di dati e necessita di padronanza dei concetti di integrazione.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















