
Corso di Analisi Big Data
Padroneggi l'intero stack big data — dall'archiviazione distribuita e l'elaborazione batch allo streaming in tempo reale e al machine learning su larga scala. Questo corso Le fornirà competenze pratiche con strumenti standard del settore come Hadoop, Spark, Kafka e Airflow. Che stia entrando nel mondo del data engineering o stia migliorando le Sue competenze attuali, alla fine sarà pronto a costruire sistemi big data di livello produttivo.
Cosa imparerai:
Svilupperà una comprensione completa degli ecosistemi big data, partendo dai concetti fondamentali e dal framework delle 5 V, per poi passare all'archiviazione distribuita con HDFS e database NoSQL. Scriverà e ottimizzerà job MapReduce, eseguirà query SQL su motori distribuiti come Hive e Presto e svilupperà applicazioni Spark avanzate utilizzando RDD, DataFrame e Spark SQL. Il corso tratta l'elaborazione di flussi in tempo reale con Kafka, Spark Structured Streaming e Apache Flink. Progetterà pipeline dati affidabili, garantirà la qualità dei dati e applicherà il machine learning su larga scala utilizzando Spark MLlib e flussi di lavoro MLOps. Le piattaforme cloud, la data governance, la sicurezza e le tendenze emergenti come il data mesh e l'ingegneria potenziata dall'IA completeranno il Suo bagaglio di competenze.
Come studi in modo pratico Corso di Analisi Big Data
Come metti in pratica Corso di Analisi Big Data
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 38 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliFondamenti dei Big Data
Fondamenti dei Big Data
Lezione 1 • Tipi e Formati di Dati
Tratta dati strutturati, semi-strutturati e non strutturati con i formati di file più comuni. Prepara gli studenti a selezionare le strategie di archiviazione ed elaborazione appropriate.
Lezione 2 • Definire i Concetti di Big Data
Introduce il framework delle 5 V e distingue i big data dai dati tradizionali. Ancora tutti gli argomenti tecnici successivi a una terminologia condivisa.
Lezione 3 • Driver di Business e Casi d'Uso
Esamina le motivazioni del settore per l'adozione dei big data e gli obiettivi analitici comuni. Collega i concetti tecnici a risultati di business misurabili.
Lezione 4 • Panoramica dell'Ecosistema Big Data
Mappa i componenti principali di una piattaforma big data, dall'ingestione alla visualizzazione. Fornisce un modello mentale per l'intera pipeline trattata nei capitoli successivi.
Capitolo 2NascondiNascondi dettagliVedi dettagliSistemi di Storage Distribuito
Sistemi di Storage Distribuito
Lezione 1 • Principi dei File System Distribuiti
Spiega la replica, la tolleranza ai guasti e il block storage nei sistemi distribuiti. Stabilisce le basi di storage necessarie per tutti i framework di elaborazione successivi.
Lezione 2 • Hadoop Distributed File System
Tratta l'architettura HDFS, la configurazione e le operazioni fondamentali per archiviare grandi dataset. Abilita direttamente il lavoro pratico con l'elaborazione basata su Hadoop nei capitoli successivi.
Lezione 3 • Fondamenti di Database NoSQL
Esamina i modelli NoSQL chiave-valore, document store, column-family e graph. Fornisce agli studenti gli strumenti per abbinare la tecnologia di storage alla struttura dei dati e ai requisiti di query.
Lezione 4 • Object Storage per Big Data
Introduce l'object storage cloud-native come alternativa scalabile a HDFS. Prepara gli studenti ad architettare soluzioni di data lake ibride e cloud-first.
Lezione 5 • Tecniche di Ottimizzazione dello Storage
Affronta compressione, partizionamento e storage a livelli per ridurre i costi e migliorare le prestazioni. Direttamente applicabile alle decisioni di progettazione dello storage in ambienti di produzione.
Capitolo 3NascondiNascondi dettagliVedi dettagliElaborazione Batch con MapReduce
Elaborazione Batch con MapReduce
Lezione 1 • Modello di Programmazione MapReduce
Spiega le fasi di map, shuffle e reduce con diagrammi del flusso dati. Fornisce il nucleo concettuale necessario prima di scrivere codice di elaborazione distribuita.
Lezione 2 • Ottimizzazione delle Prestazioni di MapReduce
Tratta impostazioni di memoria, esecuzione speculativa e parallelismo dei task per job più veloci. Collega la conoscenza teorica a miglioramenti misurabili delle prestazioni.
Lezione 3 • Scrivere Job MapReduce
Guida gli studenti nella codifica di funzioni mapper e reducer con esempi pratici. Costruisce le basi di programmazione per tutti i successivi framework di elaborazione.
Lezione 4 • Combiner e Partitioner
Introduce i combiner per l'aggregazione locale e i partitioner personalizzati per la distribuzione dei dati. Migliora direttamente l'efficienza del job e prepara gli studenti agli argomenti di ottimizzazione.
Capitolo 4NascondiNascondi dettagliVedi dettagliElaborazione Big Data Basata su SQL
Elaborazione Big Data Basata su SQL
Lezione 1 • Motori di Query SQL Distribuiti
Introduce i motori di query MPP che eseguono SQL direttamente su storage distribuito. Amplia il toolkit degli studenti oltre Hive per l'analytics interattiva e ad hoc.
Lezione 2 • Progettazione dello Schema per l'Analytics
Insegna schemi a stella e a fiocco di neve, denormalizzazione e pattern schema-on-read. Prepara gli studenti a progettare strutture di data warehouse su piattaforme big data.
Lezione 3 • Architettura e Modello Dati di Hive
Spiega il metastore di Hive, le tabelle e HiveQL come astrazione SQL su HDFS. Consente agli studenti di sfruttare le competenze SQL esistenti in un contesto distribuito.
Lezione 4 • Ottimizzazione delle Query in Hive
Tratta piani di esecuzione, vettorizzazione e ottimizzazione basata sui costi per le query Hive. Riduce direttamente la latenza delle query nelle pipeline analitiche costruite in questo capitolo.
Lezione 5 • Architettura Data Lakehouse
Unisce la flessibilità del data lake con l'affidabilità del data warehouse usando formati tabellari aperti. Posiziona gli studenti per progettare architetture moderne di analytics unificata.
Capitolo 5NascondiNascondi dettagliVedi dettagliElaborazione Big Data con Apache Spark
Elaborazione Big Data con Apache Spark
Lezione 1 • Architettura e Modello di Esecuzione di Spark
Spiega driver, executor, DAG scheduler ed esecuzione dei task nei cluster Spark. Fornisce la comprensione architetturale necessaria per scrivere e ottimizzare job Spark efficienti.
Lezione 2 • DataFrame e Spark SQL
Introduce l'API DataFrame e Spark SQL per l'elaborazione di dati strutturati su larga scala. Collega la conoscenza SQL del Capitolo 4 al motore di esecuzione ottimizzato di Spark.
Lezione 3 • Operazioni Avanzate in Spark
Tratta join, aggregazioni, funzioni finestra e funzioni definite dall'utente in Spark. Consente agli studenti di gestire trasformazioni analitiche complesse nelle pipeline di produzione.
Lezione 4 • RDD e Trasformazioni Fondamentali
Tratta i Resilient Distributed Dataset, la valutazione lazy e le operazioni chiave di trasformazione. Costruisce il modello di programmazione Spark di base prima delle API di livello superiore.
Lezione 5 • Ottimizzazione delle Prestazioni di Spark
Affronta partizionamento, gestione della memoria e diagnostica con Spark UI per l'ottimizzazione. Traduce la conoscenza architetturale in miglioramenti misurabili delle prestazioni dei job.
Capitolo 6NascondiNascondi dettagliVedi dettagliElaborazione di Flussi in Tempo Reale
Elaborazione di Flussi in Tempo Reale
Lezione 1 • Accodamento Messaggi con Kafka
Tratta topic, partizioni, produttori e consumatori Kafka come backbone di streaming. Fornisce il livello di ingestione richiesto da tutti i processori di flusso a valle.
Lezione 2 • Apache Spark Structured Streaming
Insegna lo streaming con micro-batch e continuo usando l'API DataFrame unificata di Spark. Sfrutta le competenze Spark dei capitoli batch e le estende ai carichi di lavoro di streaming.
Lezione 3 • Elaborazione di Flussi con Apache Flink
Introduce il modello di streaming nativo di Flink, i backend di stato e l'elaborazione basata sull'event time. Fornisce un'alternativa a Spark per applicazioni di streaming stateful a bassa latenza.
Lezione 4 • Pattern di Progettazione per Pipeline in Tempo Reale
Presenta le architetture Lambda, Kappa e CQRS per combinare batch e streaming. Fornisce agli studenti gli strumenti per architettare sistemi di dati end-to-end in tempo reale.
Lezione 5 • Fondamenti di Elaborazione dei Flussi
Definisce i flussi di eventi, la semantica temporale e le differenze tra elaborazione batch e streaming. Stabilisce la base concettuale per tutti i framework di streaming in questo capitolo.
Capitolo 7NascondiNascondi dettagliVedi dettagliIngegneria delle Pipeline Dati
Ingegneria delle Pipeline Dati
Lezione 1 • Qualità e Validazione dei Dati
Introduce la profilazione dei dati, la validazione dello schema e i controlli di qualità automatizzati nelle pipeline. Garantisce che i risultati analitici siano affidabili e attendibili per i consumatori a valle.
Lezione 2 • Orchestrazione dei Flussi di Lavoro con Airflow
Insegna la creazione di DAG, lo scheduling e la gestione delle dipendenze in Apache Airflow. Fornisce il livello di orchestrazione che coordina tutti i componenti della pipeline.
Lezione 3 • Strategie di Ingestione dei Dati
Tratta l'ingestione batch, il change data capture e i pattern di ingestione guidati dagli eventi. Stabilisce il punto di ingresso per tutti i dati che entrano nelle pipeline costruite in questo capitolo.
Lezione 4 • Affidabilità e Monitoraggio delle Pipeline
Tratta idempotenza, logica di retry, code dead-letter e osservabilità per le pipeline. Prepara gli studenti a mantenere infrastrutture dati di livello produttivo.
Lezione 5 • Pattern di Trasformazione dei Dati
Presenta ELT vs ETL, logica di trasformazione e framework di trasformazione riutilizzabili. Collega i livelli di ingestione e storage in prodotti dati analitici coerenti.
Capitolo 8NascondiNascondi dettagliVedi dettagliAnalytics Avanzata e Machine Learning su Larga Scala
Analytics Avanzata e Machine Learning su Larga Scala
Lezione 1 • MLOps per Pipeline Big Data
Presenta l'addestramento continuo, i feature store e il tracciamento degli esperimenti per operazioni ML scalabili. Consente agli studenti di mantenere e migliorare i modelli in ambienti di produzione.
Lezione 2 • Deployment e Serving dei Modelli
Tratta il batch scoring, l'inferenza in tempo reale e i pattern di model registry per ML in produzione. Colma il divario tra l'addestramento del modello e il valore di business operativo.
Lezione 3 • Concetti di Machine Learning Distribuito
Spiega il parallelismo dei dati, il parallelismo dei modelli e la discesa del gradiente distribuita. Stabilisce le basi teoriche per tutti i framework ML trattati in questo capitolo.
Lezione 4 • Graph Analytics su Larga Scala
Introduce i modelli di dati a grafo e l'elaborazione distribuita dei grafi per l'analisi di rete. Estende le capacità analitiche ai problemi di big data incentrati sulle relazioni.
Lezione 5 • Apprendimento Automatico con Spark MLlib
Tratta l'ingegneria delle feature, l'API pipeline e gli algoritmi fondamentali in Spark MLlib. Sfrutta le competenze Spark del Capitolo 6 per costruire flussi di lavoro ML end-to-end.
Il tuo certificato valido di completamento
Questo corso è per te:
Sviluppatore software: desidera specializzarsi in infrastrutture dati e sistemi distribuiti.
Analista dati: pronto a superare le query per progettare flussi di lavoro dati scalabili.
Ingegnere backend: cerca di espandere le proprie competenze in ambienti di elaborazione dati ad alto volume.
Studente di informatica: intende acquisire competenze pratiche per entrare nel mercato del lavoro del data engineering.
Sviluppatore BI: cerca una base tecnica più approfondita oltre i dashboard e i livelli di reporting.
Persona in transizione di carriera dall'IT operations: attratto dal data engineering attraverso l'esperienza nell'infrastruttura.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















