Scegli la tua lingua
Corso di Analisi Big Data
Più di 2 milioni di studenti in tutto il mondo

Corso di Analisi Big Data

Padroneggi l'intero stack big data — dall'archiviazione distribuita e l'elaborazione batch allo streaming in tempo reale e al machine learning su larga scala. Questo corso Le fornirà competenze pratiche con strumenti standard del settore come Hadoop, Spark, Kafka e Airflow. Che stia entrando nel mondo del data engineering o stia migliorando le Sue competenze attuali, alla fine sarà pronto a costruire sistemi big data di livello produttivo.

Dedika per aziende

Cosa imparerai:

Svilupperà una comprensione completa degli ecosistemi big data, partendo dai concetti fondamentali e dal framework delle 5 V, per poi passare all'archiviazione distribuita con HDFS e database NoSQL. Scriverà e ottimizzerà job MapReduce, eseguirà query SQL su motori distribuiti come Hive e Presto e svilupperà applicazioni Spark avanzate utilizzando RDD, DataFrame e Spark SQL. Il corso tratta l'elaborazione di flussi in tempo reale con Kafka, Spark Structured Streaming e Apache Flink. Progetterà pipeline dati affidabili, garantirà la qualità dei dati e applicherà il machine learning su larga scala utilizzando Spark MLlib e flussi di lavoro MLOps. Le piattaforme cloud, la data governance, la sicurezza e le tendenze emergenti come il data mesh e l'ingegneria potenziata dall'IA completeranno il Suo bagaglio di competenze.

Come studi in modo pratico Corso di Analisi Big Data

Come metti in pratica Corso di Analisi Big Data

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 38 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Fondamenti dei Big Data

  • Lezione 1 • Tipi e Formati di Dati

    Tratta dati strutturati, semi-strutturati e non strutturati con i formati di file più comuni. Prepara gli studenti a selezionare le strategie di archiviazione ed elaborazione appropriate.

  • Lezione 2 • Definire i Concetti di Big Data

    Introduce il framework delle 5 V e distingue i big data dai dati tradizionali. Ancora tutti gli argomenti tecnici successivi a una terminologia condivisa.

  • Lezione 3 • Driver di Business e Casi d'Uso

    Esamina le motivazioni del settore per l'adozione dei big data e gli obiettivi analitici comuni. Collega i concetti tecnici a risultati di business misurabili.

  • Lezione 4 • Panoramica dell'Ecosistema Big Data

    Mappa i componenti principali di una piattaforma big data, dall'ingestione alla visualizzazione. Fornisce un modello mentale per l'intera pipeline trattata nei capitoli successivi.

Capitolo 2Vedi dettagli

Sistemi di Storage Distribuito

  • Lezione 1 • Principi dei File System Distribuiti

    Spiega la replica, la tolleranza ai guasti e il block storage nei sistemi distribuiti. Stabilisce le basi di storage necessarie per tutti i framework di elaborazione successivi.

  • Lezione 2 • Hadoop Distributed File System

    Tratta l'architettura HDFS, la configurazione e le operazioni fondamentali per archiviare grandi dataset. Abilita direttamente il lavoro pratico con l'elaborazione basata su Hadoop nei capitoli successivi.

  • Lezione 3 • Fondamenti di Database NoSQL

    Esamina i modelli NoSQL chiave-valore, document store, column-family e graph. Fornisce agli studenti gli strumenti per abbinare la tecnologia di storage alla struttura dei dati e ai requisiti di query.

  • Lezione 4 • Object Storage per Big Data

    Introduce l'object storage cloud-native come alternativa scalabile a HDFS. Prepara gli studenti ad architettare soluzioni di data lake ibride e cloud-first.

  • Lezione 5 • Tecniche di Ottimizzazione dello Storage

    Affronta compressione, partizionamento e storage a livelli per ridurre i costi e migliorare le prestazioni. Direttamente applicabile alle decisioni di progettazione dello storage in ambienti di produzione.

Capitolo 3Vedi dettagli

Elaborazione Batch con MapReduce

  • Lezione 1 • Modello di Programmazione MapReduce

    Spiega le fasi di map, shuffle e reduce con diagrammi del flusso dati. Fornisce il nucleo concettuale necessario prima di scrivere codice di elaborazione distribuita.

  • Lezione 2 • Ottimizzazione delle Prestazioni di MapReduce

    Tratta impostazioni di memoria, esecuzione speculativa e parallelismo dei task per job più veloci. Collega la conoscenza teorica a miglioramenti misurabili delle prestazioni.

  • Lezione 3 • Scrivere Job MapReduce

    Guida gli studenti nella codifica di funzioni mapper e reducer con esempi pratici. Costruisce le basi di programmazione per tutti i successivi framework di elaborazione.

  • Lezione 4 • Combiner e Partitioner

    Introduce i combiner per l'aggregazione locale e i partitioner personalizzati per la distribuzione dei dati. Migliora direttamente l'efficienza del job e prepara gli studenti agli argomenti di ottimizzazione.

Capitolo 4Vedi dettagli

Elaborazione Big Data Basata su SQL

  • Lezione 1 • Motori di Query SQL Distribuiti

    Introduce i motori di query MPP che eseguono SQL direttamente su storage distribuito. Amplia il toolkit degli studenti oltre Hive per l'analytics interattiva e ad hoc.

  • Lezione 2 • Progettazione dello Schema per l'Analytics

    Insegna schemi a stella e a fiocco di neve, denormalizzazione e pattern schema-on-read. Prepara gli studenti a progettare strutture di data warehouse su piattaforme big data.

  • Lezione 3 • Architettura e Modello Dati di Hive

    Spiega il metastore di Hive, le tabelle e HiveQL come astrazione SQL su HDFS. Consente agli studenti di sfruttare le competenze SQL esistenti in un contesto distribuito.

  • Lezione 4 • Ottimizzazione delle Query in Hive

    Tratta piani di esecuzione, vettorizzazione e ottimizzazione basata sui costi per le query Hive. Riduce direttamente la latenza delle query nelle pipeline analitiche costruite in questo capitolo.

  • Lezione 5 • Architettura Data Lakehouse

    Unisce la flessibilità del data lake con l'affidabilità del data warehouse usando formati tabellari aperti. Posiziona gli studenti per progettare architetture moderne di analytics unificata.

Capitolo 5Vedi dettagli

Elaborazione Big Data con Apache Spark

  • Lezione 1 • Architettura e Modello di Esecuzione di Spark

    Spiega driver, executor, DAG scheduler ed esecuzione dei task nei cluster Spark. Fornisce la comprensione architetturale necessaria per scrivere e ottimizzare job Spark efficienti.

  • Lezione 2 • DataFrame e Spark SQL

    Introduce l'API DataFrame e Spark SQL per l'elaborazione di dati strutturati su larga scala. Collega la conoscenza SQL del Capitolo 4 al motore di esecuzione ottimizzato di Spark.

  • Lezione 3 • Operazioni Avanzate in Spark

    Tratta join, aggregazioni, funzioni finestra e funzioni definite dall'utente in Spark. Consente agli studenti di gestire trasformazioni analitiche complesse nelle pipeline di produzione.

  • Lezione 4 • RDD e Trasformazioni Fondamentali

    Tratta i Resilient Distributed Dataset, la valutazione lazy e le operazioni chiave di trasformazione. Costruisce il modello di programmazione Spark di base prima delle API di livello superiore.

  • Lezione 5 • Ottimizzazione delle Prestazioni di Spark

    Affronta partizionamento, gestione della memoria e diagnostica con Spark UI per l'ottimizzazione. Traduce la conoscenza architetturale in miglioramenti misurabili delle prestazioni dei job.

Capitolo 6Vedi dettagli

Elaborazione di Flussi in Tempo Reale

  • Lezione 1 • Accodamento Messaggi con Kafka

    Tratta topic, partizioni, produttori e consumatori Kafka come backbone di streaming. Fornisce il livello di ingestione richiesto da tutti i processori di flusso a valle.

  • Lezione 2 • Apache Spark Structured Streaming

    Insegna lo streaming con micro-batch e continuo usando l'API DataFrame unificata di Spark. Sfrutta le competenze Spark dei capitoli batch e le estende ai carichi di lavoro di streaming.

  • Lezione 3 • Elaborazione di Flussi con Apache Flink

    Introduce il modello di streaming nativo di Flink, i backend di stato e l'elaborazione basata sull'event time. Fornisce un'alternativa a Spark per applicazioni di streaming stateful a bassa latenza.

  • Lezione 4 • Pattern di Progettazione per Pipeline in Tempo Reale

    Presenta le architetture Lambda, Kappa e CQRS per combinare batch e streaming. Fornisce agli studenti gli strumenti per architettare sistemi di dati end-to-end in tempo reale.

  • Lezione 5 • Fondamenti di Elaborazione dei Flussi

    Definisce i flussi di eventi, la semantica temporale e le differenze tra elaborazione batch e streaming. Stabilisce la base concettuale per tutti i framework di streaming in questo capitolo.

Capitolo 7Vedi dettagli

Ingegneria delle Pipeline Dati

  • Lezione 1 • Qualità e Validazione dei Dati

    Introduce la profilazione dei dati, la validazione dello schema e i controlli di qualità automatizzati nelle pipeline. Garantisce che i risultati analitici siano affidabili e attendibili per i consumatori a valle.

  • Lezione 2 • Orchestrazione dei Flussi di Lavoro con Airflow

    Insegna la creazione di DAG, lo scheduling e la gestione delle dipendenze in Apache Airflow. Fornisce il livello di orchestrazione che coordina tutti i componenti della pipeline.

  • Lezione 3 • Strategie di Ingestione dei Dati

    Tratta l'ingestione batch, il change data capture e i pattern di ingestione guidati dagli eventi. Stabilisce il punto di ingresso per tutti i dati che entrano nelle pipeline costruite in questo capitolo.

  • Lezione 4 • Affidabilità e Monitoraggio delle Pipeline

    Tratta idempotenza, logica di retry, code dead-letter e osservabilità per le pipeline. Prepara gli studenti a mantenere infrastrutture dati di livello produttivo.

  • Lezione 5 • Pattern di Trasformazione dei Dati

    Presenta ELT vs ETL, logica di trasformazione e framework di trasformazione riutilizzabili. Collega i livelli di ingestione e storage in prodotti dati analitici coerenti.

Capitolo 8Vedi dettagli

Analytics Avanzata e Machine Learning su Larga Scala

  • Lezione 1 • MLOps per Pipeline Big Data

    Presenta l'addestramento continuo, i feature store e il tracciamento degli esperimenti per operazioni ML scalabili. Consente agli studenti di mantenere e migliorare i modelli in ambienti di produzione.

  • Lezione 2 • Deployment e Serving dei Modelli

    Tratta il batch scoring, l'inferenza in tempo reale e i pattern di model registry per ML in produzione. Colma il divario tra l'addestramento del modello e il valore di business operativo.

  • Lezione 3 • Concetti di Machine Learning Distribuito

    Spiega il parallelismo dei dati, il parallelismo dei modelli e la discesa del gradiente distribuita. Stabilisce le basi teoriche per tutti i framework ML trattati in questo capitolo.

  • Lezione 4 • Graph Analytics su Larga Scala

    Introduce i modelli di dati a grafo e l'elaborazione distribuita dei grafi per l'analisi di rete. Estende le capacità analitiche ai problemi di big data incentrati sulle relazioni.

  • Lezione 5 • Apprendimento Automatico con Spark MLlib

    Tratta l'ingegneria delle feature, l'API pipeline e gli algoritmi fondamentali in Spark MLlib. Sfrutta le competenze Spark del Capitolo 6 per costruire flussi di lavoro ML end-to-end.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Sviluppatore software: desidera specializzarsi in infrastrutture dati e sistemi distribuiti.

  • Analista dati: pronto a superare le query per progettare flussi di lavoro dati scalabili.

  • Ingegnere backend: cerca di espandere le proprie competenze in ambienti di elaborazione dati ad alto volume.

  • Studente di informatica: intende acquisire competenze pratiche per entrare nel mercato del lavoro del data engineering.

  • Sviluppatore BI: cerca una base tecnica più approfondita oltre i dashboard e i livelli di reporting.

  • Persona in transizione di carriera dall'IT operations: attratto dal data engineering attraverso l'esperienza nell'infrastruttura.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF