
Apache Hive: Design, Query, and Optimize Big Data Course
Padroneggi Apache Hive dalle fondamenta — progettando schemi, scrivendo potenti query HiveQL e ottimizzando le prestazioni su dataset massivi. Questo corso copre tutto, dai fondamenti di HDFS e le transazioni ACID alla distribuzione cloud, alla sicurezza e all'orchestrazione dei flussi di lavoro. Che Lei stia costruendo pipeline di dati aziendali o ottimizzando un data lakehouse, acquisirà le competenze pratiche richieste dagli ambienti di produzione.
Cosa imparerai:
Progetti tabelle Hive gestite ed esterne con partizionamento, bucketing e formati di storage a colonne.
Scriva query HiveQL avanzate utilizzando funzioni finestra, CTE, sottoquery e join tra più tabelle.
Ottimizzi l'esecuzione delle query applicando il pruning delle partizioni, la vettorizzazione e il tuning dell'ottimizzatore basato sui costi.
Implementi la sicurezza di Hive utilizzando l'autenticazione Kerberos, le policy di Apache Ranger e il mascheramento dinamico dei dati.
Integri Hive con Apache Spark, object storage cloud e formati di tabella aperti come Apache Iceberg.
Automatizzi le pipeline di dati con Apache Airflow e Oozie, incluso il caricamento incrementale e i controlli di qualità.
Come studi in modo pratico Apache Hive: Design, Query, and Optimize Big Data Course
Come metti in pratica Apache Hive: Design, Query, and Optimize Big Data Course
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 37 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliIntroduzione ai Big Data e a Hive
Introduzione ai Big Data e a Hive
Lezione 1 • Architettura e Componenti di Hive
Spiega i componenti principali di Hive: metastore, driver, compilatore e motore di esecuzione. Collega l'architettura alla comprensione del ciclo di vita delle query.
Lezione 2 • Fondamenti e Sfide dei Big Data
Tratta le sfide di volume, velocità e varietà che guidano l'adozione dei big data. Stabilisce il contesto del perché esistono strumenti di elaborazione distribuita come Hive.
Lezione 3 • Configurazione di un Ambiente Hive
Guida all'installazione e alla configurazione di un ambiente Hive locale o sandbox. Fornisce la preparazione pratica per tutti i capitoli successivi.
Lezione 4 • Hive vs. Database Tradizionali
Contrappone il modello schema-on-read di Hive allo schema-on-write degli RDBMS. Gli studenti comprendono quando Hive è appropriato rispetto alle alternative relazionali.
Capitolo 2NascondiNascondi dettagliVedi dettagliFondamenti di HiveQL e Tipi di Dato
Fondamenti di HiveQL e Tipi di Dato
Lezione 1 • Tipi di Dato Primitivi e Complessi
Tratta i tipi primitivi numerici, stringa, booleani e data insieme ai tipi complessi ARRAY, MAP e STRUCT. La scelta corretta del tipo influisce sullo storage e sull'accuratezza delle query.
Lezione 2 • Sintassi HiveQL e Struttura delle Query
Introduce HiveQL come un dialetto SQL con estensioni specifiche di Hive. Tratta le clausole SELECT, FROM, WHERE e ORDER BY come elementi costitutivi.
Lezione 3 • Aggregazione e Raggruppamento
Insegna GROUP BY, HAVING e le funzioni di aggregazione per riassumere i dataset. L'aggregazione è fondamentale per i pattern di query analitiche utilizzati in tutto il corso.
Lezione 4 • Sottoquery ed Espressioni di Tabella Comuni
Introduce viste inline, sottoquery e CTE con clausola WITH per una progettazione modulare delle query. Questi pattern compaiono in query analitiche complesse nei capitoli successivi.
Lezione 5 • Funzioni e Operatori Integrati
Esamina le funzioni integrate per stringhe, matematica, date e condizionali. Gli studenti applicano le funzioni per trasformare e valutare i dati all'interno delle query.
Capitolo 3NascondiNascondi dettagliVedi dettagliProgettazione di Database e Tabelle in Hive
Progettazione di Database e Tabelle in Hive
Lezione 1 • Partizionamento delle Tabelle
Insegna il partizionamento statico e dinamico per ridurre le scansioni complete della tabella. Il partizionamento è la tecnica principale per migliorare le prestazioni delle query su tabelle di grandi dimensioni.
Lezione 2 • Creazione e Gestione dei Database
Tratta CREATE DATABASE, DROP DATABASE e le proprietà del database. Un'organizzazione corretta del database supporta la governance dei dati multi-team.
Lezione 3 • Formati di Storage delle Tabelle
Confronta i formati di storage TextFile, SequenceFile, ORC e Parquet. La scelta del formato influisce direttamente sulla velocità delle query e sull'efficienza dello storage.
Lezione 4 • Tabelle Gestite vs. Esterne
Distingue le tabelle gestite (dati di proprietà di Hive) dalle tabelle esterne (dati di proprietà dell'utente). Una scelta corretta previene la perdita accidentale di dati.
Lezione 5 • Bucketing e Clustering
Introduce il bucketing come complemento al partizionamento per una distribuzione uniforme dei dati. Le tabelle con bucket consentono un campionamento e un'ottimizzazione dei join efficienti.
Capitolo 4NascondiNascondi dettagliVedi dettagliCaricamento, Inserimento e Gestione dei Dati
Caricamento, Inserimento e Gestione dei Dati
Lezione 1 • Caricamento Dati da File
Tratta LOAD DATA LOCAL e LOAD DATA da percorsi HDFS. Il caricamento basato su file è il pattern di inserimento iniziale più comune nei flussi di lavoro Hive.
Lezione 2 • Transazioni ACID e Operazioni CRUD
Spiega il supporto ACID di Hive che abilita UPDATE e DELETE su tabelle ORC. Le operazioni ACID richiedono una configurazione e proprietà della tabella specifiche.
Lezione 3 • Pattern INSERT e INSERT OVERWRITE
Insegna INSERT INTO e INSERT OVERWRITE per il popolamento dei dati basato su query. Questi pattern supportano pipeline ETL costruite interamente in HiveQL.
Lezione 4 • Esportazione e Archiviazione dei Dati
Tratta INSERT OVERWRITE DIRECTORY e i comandi EXPORT/IMPORT. L'esportazione dei dati supporta il consumo a valle e la migrazione tra cluster.
Capitolo 5NascondiNascondi dettagliVedi dettagliJoin, Union e Query Avanzate
Join, Union e Query Avanzate
Lezione 1 • Skew Join e Gestione dello Sbilanciamento dei Dati
Affronta lo sbilanciamento dei join causato da valori chiave ad alta frequenza che sovraccaricano i reducer. L'ottimizzazione skew join distribuisce le chiavi calde su più task.
Lezione 2 • Tipi di Join e Sintassi
Tratta i join INNER, LEFT, RIGHT, FULL OUTER e CROSS con la sintassi HiveQL. Comprendere la semantica dei join previene set di risultati errati.
Lezione 3 • UNION, INTERSECT ed EXCEPT
Insegna le operazioni sugli insiemi per combinare e confrontare set di risultati tra query. Queste operazioni supportano pattern di deduplicazione e analisi differenziale.
Lezione 4 • Join Map-Side e Broadcast
Spiega i join map-side utilizzando l'hint MAPJOIN per l'ottimizzazione con tabelle piccole. I join broadcast eliminano l'overhead di shuffle nei join tra tabelle grandi e piccole.
Lezione 5 • Funzioni Finestra e Analitiche
Introduce OVER, PARTITION BY e ORDER BY per il ranking e le aggregazioni in esecuzione. Le funzioni finestra consentono analisi avanzate senza collassare la granularità delle righe.
Capitolo 6NascondiNascondi dettagliVedi dettagliTecniche di Ottimizzazione delle Query
Tecniche di Ottimizzazione delle Query
Lezione 1 • Comprendere il Piano di Esecuzione delle Query
Utilizza EXPLAIN e EXPLAIN EXTENDED per interpretare i piani di esecuzione MapReduce e Tez. Leggere i piani è la competenza prerequisita per tutte le decisioni di ottimizzazione.
Lezione 2 • Ottimizzazione del Motore di Esecuzione Tez
Configura l'esecuzione DAG di Tez per una latenza ridotta rispetto a MapReduce. Tez è il motore consigliato per carichi di lavoro Hive interattivi e iterativi.
Lezione 3 • Partition Pruning e Predicate Pushdown
Assicura che le query analizzino solo le partizioni pertinenti e spingano i filtri il prima possibile. Queste tecniche riducono l'I/O, che è il costo dominante nelle query Hive.
Lezione 4 • Ottimizzazione del Formato File e della Compressione
Seleziona ORC e Parquet con codec di compressione appropriati per minimizzare il tempo di scansione. La compressione riduce sia il costo di storage che l'I/O di rete durante l'esecuzione delle query.
Lezione 5 • Vettorizzazione e Ottimizzatore Basato sui Costi
Abilita l'esecuzione vettorizzata delle query e l'ottimizzatore basato sui costi (CBO) per il miglioramento automatico del piano. Entrambi richiedono la raccolta di statistiche per funzionare correttamente.
Capitolo 7NascondiNascondi dettagliVedi dettagliFunzioni Definite dall'Utente ed Estendibilità
Funzioni Definite dall'Utente ed Estendibilità
Lezione 1 • Funzioni di Tabella Definite dall'Utente
Costruisce UDTF che emettono più righe da una singola riga di input utilizzando l'interfaccia UDTF. Le UDTF supportano l'esplosione di strutture annidate e la generazione di righe personalizzate.
Lezione 2 • Funzioni di Aggregazione Definite dall'Utente
Implementa UDAF utilizzando le interfacce UDAF e GenericUDAF per aggregazioni personalizzate. Le UDAF operano tra gruppi di reducer e richiedono la gestione del buffer.
Lezione 3 • Fondamenti dello Sviluppo di UDF
Tratta la classe base UDF, il metodo evaluate e il packaging JAR per semplici funzioni scalari. Le UDF colmano le lacune dove le funzioni integrate sono insufficienti.
Lezione 4 • Trasformazioni Python e Basate su Script
Utilizza TRANSFORM e script di streaming per applicare logica Python o shell all'interno di HiveQL. Le trasformazioni tramite script consentono una prototipazione rapida senza compilazione Java.
Capitolo 8NascondiNascondi dettagliVedi dettagliHive in Produzione: Sicurezza e Governance
Hive in Produzione: Sicurezza e Governance
Lezione 1 • Gestione del Metastore e Alta Disponibilità
Configura un metastore remoto con un backend relazionale e una configurazione ad alta disponibilità. L'affidabilità del metastore è critica per un servizio Hive ininterrotto in produzione.
Lezione 2 • Modelli di Autorizzazione: Standard SQL e Ranger
Confronta l'autorizzazione standard SQL di Hive con il controllo basato su policy di Apache Ranger. L'autorizzazione granulare applica l'accesso con minimo privilegio a livello di colonna.
Lezione 3 • Autenticazione e Integrazione Kerberos
Configura l'autenticazione basata su Kerberos per HiveServer2 e le connessioni client. L'autenticazione previene l'accesso non autorizzato a risorse di dati sensibili.
Lezione 4 • Mascheramento e Cifratura dei Dati
Applica policy dinamiche di mascheramento dei dati e zone di cifratura HDFS per proteggere le colonne sensibili. Il mascheramento consente analisi su dati sensibili senza esporre i valori originali.
Lezione 5 • Auditing e Logging di Conformità
Abilita i log di audit delle query tramite HiveServer2 e le tracce di audit di Apache Ranger. I log di audit soddisfano i requisiti di conformità normativa per il tracciamento degli accessi ai dati.
Il tuo certificato valido di completamento
Questo corso è per te:
Analisti di dati pronti a perfezionare le proprie competenze oltre i fogli di calcolo e SQL.
Ingegneri del software in transizione verso ruoli legati ai big data e ai sistemi distribuiti.
Sviluppatori ETL che desiderano modernizzare le pipeline utilizzando strumenti basati su Hadoop.
Amministratori di database che esplorano lo storage colonnare e il tuning delle query su larga scala.
Professionisti di business intelligence i cui dataset sono diventati troppo grandi per i database relazionali.
Ingegneri cloud incaricati di costruire o migrare l'infrastruttura del data warehouse.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















