Scegli la tua lingua
Apache Hive: Design, Query, and Optimize Big Data Course
Più di 2 milioni di studenti in tutto il mondo

Apache Hive: Design, Query, and Optimize Big Data Course

Padroneggi Apache Hive dalle fondamenta — progettando schemi, scrivendo potenti query HiveQL e ottimizzando le prestazioni su dataset massivi. Questo corso copre tutto, dai fondamenti di HDFS e le transazioni ACID alla distribuzione cloud, alla sicurezza e all'orchestrazione dei flussi di lavoro. Che Lei stia costruendo pipeline di dati aziendali o ottimizzando un data lakehouse, acquisirà le competenze pratiche richieste dagli ambienti di produzione.

Dedika per aziende

Cosa imparerai:

  • Progetti tabelle Hive gestite ed esterne con partizionamento, bucketing e formati di storage a colonne.

  • Scriva query HiveQL avanzate utilizzando funzioni finestra, CTE, sottoquery e join tra più tabelle.

  • Ottimizzi l'esecuzione delle query applicando il pruning delle partizioni, la vettorizzazione e il tuning dell'ottimizzatore basato sui costi.

  • Implementi la sicurezza di Hive utilizzando l'autenticazione Kerberos, le policy di Apache Ranger e il mascheramento dinamico dei dati.

  • Integri Hive con Apache Spark, object storage cloud e formati di tabella aperti come Apache Iceberg.

  • Automatizzi le pipeline di dati con Apache Airflow e Oozie, incluso il caricamento incrementale e i controlli di qualità.

Come studi in modo pratico Apache Hive: Design, Query, and Optimize Big Data Course

Come metti in pratica Apache Hive: Design, Query, and Optimize Big Data Course

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 37 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Introduzione ai Big Data e a Hive

  • Lezione 1 • Architettura e Componenti di Hive

    Spiega i componenti principali di Hive: metastore, driver, compilatore e motore di esecuzione. Collega l'architettura alla comprensione del ciclo di vita delle query.

  • Lezione 2 • Fondamenti e Sfide dei Big Data

    Tratta le sfide di volume, velocità e varietà che guidano l'adozione dei big data. Stabilisce il contesto del perché esistono strumenti di elaborazione distribuita come Hive.

  • Lezione 3 • Configurazione di un Ambiente Hive

    Guida all'installazione e alla configurazione di un ambiente Hive locale o sandbox. Fornisce la preparazione pratica per tutti i capitoli successivi.

  • Lezione 4 • Hive vs. Database Tradizionali

    Contrappone il modello schema-on-read di Hive allo schema-on-write degli RDBMS. Gli studenti comprendono quando Hive è appropriato rispetto alle alternative relazionali.

Capitolo 2Vedi dettagli

Fondamenti di HiveQL e Tipi di Dato

  • Lezione 1 • Tipi di Dato Primitivi e Complessi

    Tratta i tipi primitivi numerici, stringa, booleani e data insieme ai tipi complessi ARRAY, MAP e STRUCT. La scelta corretta del tipo influisce sullo storage e sull'accuratezza delle query.

  • Lezione 2 • Sintassi HiveQL e Struttura delle Query

    Introduce HiveQL come un dialetto SQL con estensioni specifiche di Hive. Tratta le clausole SELECT, FROM, WHERE e ORDER BY come elementi costitutivi.

  • Lezione 3 • Aggregazione e Raggruppamento

    Insegna GROUP BY, HAVING e le funzioni di aggregazione per riassumere i dataset. L'aggregazione è fondamentale per i pattern di query analitiche utilizzati in tutto il corso.

  • Lezione 4 • Sottoquery ed Espressioni di Tabella Comuni

    Introduce viste inline, sottoquery e CTE con clausola WITH per una progettazione modulare delle query. Questi pattern compaiono in query analitiche complesse nei capitoli successivi.

  • Lezione 5 • Funzioni e Operatori Integrati

    Esamina le funzioni integrate per stringhe, matematica, date e condizionali. Gli studenti applicano le funzioni per trasformare e valutare i dati all'interno delle query.

Capitolo 3Vedi dettagli

Progettazione di Database e Tabelle in Hive

  • Lezione 1 • Partizionamento delle Tabelle

    Insegna il partizionamento statico e dinamico per ridurre le scansioni complete della tabella. Il partizionamento è la tecnica principale per migliorare le prestazioni delle query su tabelle di grandi dimensioni.

  • Lezione 2 • Creazione e Gestione dei Database

    Tratta CREATE DATABASE, DROP DATABASE e le proprietà del database. Un'organizzazione corretta del database supporta la governance dei dati multi-team.

  • Lezione 3 • Formati di Storage delle Tabelle

    Confronta i formati di storage TextFile, SequenceFile, ORC e Parquet. La scelta del formato influisce direttamente sulla velocità delle query e sull'efficienza dello storage.

  • Lezione 4 • Tabelle Gestite vs. Esterne

    Distingue le tabelle gestite (dati di proprietà di Hive) dalle tabelle esterne (dati di proprietà dell'utente). Una scelta corretta previene la perdita accidentale di dati.

  • Lezione 5 • Bucketing e Clustering

    Introduce il bucketing come complemento al partizionamento per una distribuzione uniforme dei dati. Le tabelle con bucket consentono un campionamento e un'ottimizzazione dei join efficienti.

Capitolo 4Vedi dettagli

Caricamento, Inserimento e Gestione dei Dati

  • Lezione 1 • Caricamento Dati da File

    Tratta LOAD DATA LOCAL e LOAD DATA da percorsi HDFS. Il caricamento basato su file è il pattern di inserimento iniziale più comune nei flussi di lavoro Hive.

  • Lezione 2 • Transazioni ACID e Operazioni CRUD

    Spiega il supporto ACID di Hive che abilita UPDATE e DELETE su tabelle ORC. Le operazioni ACID richiedono una configurazione e proprietà della tabella specifiche.

  • Lezione 3 • Pattern INSERT e INSERT OVERWRITE

    Insegna INSERT INTO e INSERT OVERWRITE per il popolamento dei dati basato su query. Questi pattern supportano pipeline ETL costruite interamente in HiveQL.

  • Lezione 4 • Esportazione e Archiviazione dei Dati

    Tratta INSERT OVERWRITE DIRECTORY e i comandi EXPORT/IMPORT. L'esportazione dei dati supporta il consumo a valle e la migrazione tra cluster.

Capitolo 5Vedi dettagli

Join, Union e Query Avanzate

  • Lezione 1 • Skew Join e Gestione dello Sbilanciamento dei Dati

    Affronta lo sbilanciamento dei join causato da valori chiave ad alta frequenza che sovraccaricano i reducer. L'ottimizzazione skew join distribuisce le chiavi calde su più task.

  • Lezione 2 • Tipi di Join e Sintassi

    Tratta i join INNER, LEFT, RIGHT, FULL OUTER e CROSS con la sintassi HiveQL. Comprendere la semantica dei join previene set di risultati errati.

  • Lezione 3 • UNION, INTERSECT ed EXCEPT

    Insegna le operazioni sugli insiemi per combinare e confrontare set di risultati tra query. Queste operazioni supportano pattern di deduplicazione e analisi differenziale.

  • Lezione 4 • Join Map-Side e Broadcast

    Spiega i join map-side utilizzando l'hint MAPJOIN per l'ottimizzazione con tabelle piccole. I join broadcast eliminano l'overhead di shuffle nei join tra tabelle grandi e piccole.

  • Lezione 5 • Funzioni Finestra e Analitiche

    Introduce OVER, PARTITION BY e ORDER BY per il ranking e le aggregazioni in esecuzione. Le funzioni finestra consentono analisi avanzate senza collassare la granularità delle righe.

Capitolo 6Vedi dettagli

Tecniche di Ottimizzazione delle Query

  • Lezione 1 • Comprendere il Piano di Esecuzione delle Query

    Utilizza EXPLAIN e EXPLAIN EXTENDED per interpretare i piani di esecuzione MapReduce e Tez. Leggere i piani è la competenza prerequisita per tutte le decisioni di ottimizzazione.

  • Lezione 2 • Ottimizzazione del Motore di Esecuzione Tez

    Configura l'esecuzione DAG di Tez per una latenza ridotta rispetto a MapReduce. Tez è il motore consigliato per carichi di lavoro Hive interattivi e iterativi.

  • Lezione 3 • Partition Pruning e Predicate Pushdown

    Assicura che le query analizzino solo le partizioni pertinenti e spingano i filtri il prima possibile. Queste tecniche riducono l'I/O, che è il costo dominante nelle query Hive.

  • Lezione 4 • Ottimizzazione del Formato File e della Compressione

    Seleziona ORC e Parquet con codec di compressione appropriati per minimizzare il tempo di scansione. La compressione riduce sia il costo di storage che l'I/O di rete durante l'esecuzione delle query.

  • Lezione 5 • Vettorizzazione e Ottimizzatore Basato sui Costi

    Abilita l'esecuzione vettorizzata delle query e l'ottimizzatore basato sui costi (CBO) per il miglioramento automatico del piano. Entrambi richiedono la raccolta di statistiche per funzionare correttamente.

Capitolo 7Vedi dettagli

Funzioni Definite dall'Utente ed Estendibilità

  • Lezione 1 • Funzioni di Tabella Definite dall'Utente

    Costruisce UDTF che emettono più righe da una singola riga di input utilizzando l'interfaccia UDTF. Le UDTF supportano l'esplosione di strutture annidate e la generazione di righe personalizzate.

  • Lezione 2 • Funzioni di Aggregazione Definite dall'Utente

    Implementa UDAF utilizzando le interfacce UDAF e GenericUDAF per aggregazioni personalizzate. Le UDAF operano tra gruppi di reducer e richiedono la gestione del buffer.

  • Lezione 3 • Fondamenti dello Sviluppo di UDF

    Tratta la classe base UDF, il metodo evaluate e il packaging JAR per semplici funzioni scalari. Le UDF colmano le lacune dove le funzioni integrate sono insufficienti.

  • Lezione 4 • Trasformazioni Python e Basate su Script

    Utilizza TRANSFORM e script di streaming per applicare logica Python o shell all'interno di HiveQL. Le trasformazioni tramite script consentono una prototipazione rapida senza compilazione Java.

Capitolo 8Vedi dettagli

Hive in Produzione: Sicurezza e Governance

  • Lezione 1 • Gestione del Metastore e Alta Disponibilità

    Configura un metastore remoto con un backend relazionale e una configurazione ad alta disponibilità. L'affidabilità del metastore è critica per un servizio Hive ininterrotto in produzione.

  • Lezione 2 • Modelli di Autorizzazione: Standard SQL e Ranger

    Confronta l'autorizzazione standard SQL di Hive con il controllo basato su policy di Apache Ranger. L'autorizzazione granulare applica l'accesso con minimo privilegio a livello di colonna.

  • Lezione 3 • Autenticazione e Integrazione Kerberos

    Configura l'autenticazione basata su Kerberos per HiveServer2 e le connessioni client. L'autenticazione previene l'accesso non autorizzato a risorse di dati sensibili.

  • Lezione 4 • Mascheramento e Cifratura dei Dati

    Applica policy dinamiche di mascheramento dei dati e zone di cifratura HDFS per proteggere le colonne sensibili. Il mascheramento consente analisi su dati sensibili senza esporre i valori originali.

  • Lezione 5 • Auditing e Logging di Conformità

    Abilita i log di audit delle query tramite HiveServer2 e le tracce di audit di Apache Ranger. I log di audit soddisfano i requisiti di conformità normativa per il tracciamento degli accessi ai dati.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Analisti di dati pronti a perfezionare le proprie competenze oltre i fogli di calcolo e SQL.

  • Ingegneri del software in transizione verso ruoli legati ai big data e ai sistemi distribuiti.

  • Sviluppatori ETL che desiderano modernizzare le pipeline utilizzando strumenti basati su Hadoop.

  • Amministratori di database che esplorano lo storage colonnare e il tuning delle query su larga scala.

  • Professionisti di business intelligence i cui dataset sono diventati troppo grandi per i database relazionali.

  • Ingegneri cloud incaricati di costruire o migrare l'infrastruttura del data warehouse.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF