
Curs de interogare și optimizare Apache Hive
Stăpânește Apache Hive de la zero — proiectând scheme, scriind interogări HiveQL puternice și ajustând performanța pe seturi masive de date. Acest curs acoperă totul, de la fundamentele HDFS și tranzacțiile ACID până la deployment în cloud, securitate și orchestrarea fluxurilor de lucru. Indiferent dacă construiești pipeline-uri de date enterprise sau optimizezi un data lakehouse, vei dobândi abilitățile practice pe care mediile de producție le cer.
Ce vei învăța:
Proiectați tabele Hive gestionate și externe cu partiționare, bucketizare și formate de stocare columnare.
Scrieți interogări HiveQL avansate folosind funcții de fereastră, CTE-uri, subinterogări și join-uri pe mai multe tabele.
Optimizați execuția interogărilor prin aplicarea prunerii partițiilor, vectorizării și ajustării optimizatorului bazat pe costuri.
Implementați securitatea Hive folosind autentificare Kerberos, politici Apache Ranger și mascare dinamică a datelor.
Integrați Hive cu Apache Spark, stocare în obiecte cloud și formate de tabele deschise precum Apache Iceberg.
Automatizați pipeline-urile de date cu Apache Airflow și Oozie, inclusiv încărcare incrementală și verificări de calitate.
Cum studiezi practic Curs de interogare și optimizare Apache Hive
Cum exersezi Curs de interogare și optimizare Apache Hive
Pentru tine, care reprezinți o companie și vrei să îți instruiești echipa
La Dedika pentru companii, cursul vine cu exerciții și exemple adaptate afacerii tale și exact așa cum are nevoie compania ta.
Conținutul cursului
8 Capitole • 37 LecțiiDurata între 4 și 360 ore (tu decizi)
Capitolul 1AscundeAscunde detaliiVezi detaliiIntroducere în Big Data și Hive
Introducere în Big Data și Hive
Lecția 1 • Arhitectura și componentele Hive
Explică componentele de bază ale lui Hive: metastore, driver, compilator și motor de execuție. Leagă arhitectura de înțelegerea ciclului de viață al unei interogări.
Lecția 2 • Fundamentele Big Data și provocările
Acoperă provocările legate de volum, viteză și varietate care determină adoptarea big data. Stabilește contextul pentru existența uneltelor de procesare distribuită precum Hive.
Lecția 3 • Configurarea unui mediu Hive
Ghidează instalarea și configurarea unui mediu Hive local sau sandbox. Oferă pregătire practică pentru toate capitolele următoare.
Lecția 4 • Hive versus baze de date tradiționale
Contrastează modelul schema-on-read al lui Hive cu schema-on-write al RDBMS. Cursanții înțeleg când Hive este adecvat versus alternativele relaționale.
Capitolul 2AscundeAscunde detaliiVezi detaliiFundamentele HiveQL și tipurile de date
Fundamentele HiveQL și tipurile de date
Lecția 1 • Tipuri de date primitive și complexe
Acoperă tipurile numerice, șir, boolean și dată primitive, alături de tipurile complexe ARRAY, MAP și STRUCT. Selectarea corectă a tipului afectează stocarea și acuratețea interogărilor.
Lecția 2 • Sintaxa HiveQL și structura interogării
Introduce HiveQL ca dialect SQL cu extensii specifice Hive. Acoperă clauzele SELECT, FROM, WHERE și ORDER BY ca elemente de bază.
Lecția 3 • Agregare și grupare
Predă GROUP BY, HAVING și funcții de agregare pentru sumarizarea seturilor de date. Agregarea este fundamentală pentru modelele de interogări analitice utilizate pe parcursul cursului.
Lecția 4 • Subinterogări și expresii de tabel comune
Introduce vizualizări inline, subinterogări și CTE-uri cu clauza WITH pentru proiectarea modulară a interogărilor. Aceste modele apar în interogări analitice complexe în capitolele ulterioare.
Lecția 5 • Funcții și operatori încorporați
Prezintă funcțiile încorporate pentru șiruri, matematică, dată și condiționale. Cursanții aplică funcții pentru a transforma și evalua date în cadrul interogărilor.
Capitolul 3AscundeAscunde detaliiVezi detaliiProiectarea bazelor de date și tabelelor în Hive
Proiectarea bazelor de date și tabelelor în Hive
Lecția 1 • Partiționarea tabelelor
Predă partiționarea statică și dinamică pentru a reduce scanările complete ale tabelelor. Partiționarea este tehnica principală pentru îmbunătățirea performanței interogărilor pe tabele mari.
Lecția 2 • Crearea și gestionarea bazelor de date
Acoperă CREATE DATABASE, DROP DATABASE și proprietățile bazelor de date. Organizarea corectă a bazelor de date sprijină guvernanța datelor în medii multi-echipă.
Lecția 3 • Formate de stocare a tabelelor
Compară formatele de stocare TextFile, SequenceFile, ORC și Parquet. Alegerea formatului afectează direct viteza interogărilor și eficiența stocării.
Lecția 4 • Tabele gestionate versus tabele externe
Distinge între tabelele gestionate (date deținute de Hive) și tabelele externe (date deținute de utilizator). Alegerea corectă previne pierderea accidentală a datelor.
Lecția 5 • Bucketing și grupare (clustering)
Introduce bucketing-ul ca o completare a partiționării pentru o distribuție uniformă a datelor. Tabelele bucketate permit eșantionarea eficientă și optimizarea join-urilor.
Capitolul 4AscundeAscunde detaliiVezi detaliiÎncărcarea, inserarea și gestionarea datelor
Încărcarea, inserarea și gestionarea datelor
Lecția 1 • Încărcarea datelor din fișiere
Acoperă LOAD DATA LOCAL și LOAD DATA din căi HDFS. Încărcarea bazată pe fișiere este cel mai comun model de ingerare inițială în fluxurile de lucru Hive.
Lecția 2 • Tranzacțiile ACID și operațiile CRUD
Explică suportul ACID al lui Hive care permite UPDATE și DELETE pe tabele ORC. Operațiile ACID necesită o configurare specifică și proprietăți de tabel.
Lecția 3 • Modele INSERT și INSERT OVERWRITE
Predă INSERT INTO și INSERT OVERWRITE pentru popularea datelor bazată pe interogări. Aceste modele sprijină pipeline-urile ETL construite exclusiv în HiveQL.
Lecția 4 • Exportarea și arhivarea datelor
Acoperă INSERT OVERWRITE DIRECTORY și comenzile EXPORT/IMPORT. Exportul datelor sprijină consumul în aval și migrarea între clustere.
Capitolul 5AscundeAscunde detaliiVezi detaliiJoin-uri, uniuni și interogări avansate
Join-uri, uniuni și interogări avansate
Lecția 1 • Join-uri asimetrice (skew joins) și gestionarea distribuției neuniforme a datelor (data skew)
Abordează skew-ul join-urilor cauzat de valorile cheie de înaltă frecvență care supraîncarcă reducătorii. Optimizarea skew join distribuie cheile fierbinți în mai multe task-uri.
Lecția 2 • Tipuri de join-uri și sintaxă
Acoperă join-urile INNER, LEFT, RIGHT, FULL OUTER și CROSS cu sintaxa HiveQL. Înțelegerea semanticii join-urilor previne seturile de rezultate incorecte.
Lecția 3 • UNION, INTERSECT și EXCEPT
Predă operațiile pe seturi pentru combinarea și compararea seturilor de rezultate între interogări. Aceste operații sprijină modelele de deduplicare și analiză diferențială.
Lecția 4 • Join-uri map-side și broadcast
Explică join-urile map-side folosind sugestia MAPJOIN pentru optimizarea tabelelor mici. Join-urile broadcast elimină costul shuffle-ului în join-urile între un tabel mare și unul mic.
Lecția 5 • Funcții fereastră și analitice
Introduce OVER, PARTITION BY și ORDER BY pentru clasamente și agregări rulante. Funcțiile fereastră permit analize avansate fără a pierde granularitatea rândurilor.
Capitolul 6AscundeAscunde detaliiVezi detaliiTehnici de optimizare a interogărilor
Tehnici de optimizare a interogărilor
Lecția 1 • Înțelegerea planului de execuție a interogării
Folosește EXPLAIN și EXPLAIN EXTENDED pentru a interpreta planurile de execuție MapReduce și Tez. Citirea planurilor este abilitatea prealabilă esențială pentru toate deciziile de optimizare.
Lecția 2 • Ajustarea motorului de execuție Tez
Configurează execuția DAG Tez pentru o latență redusă comparativ cu MapReduce. Tez este motorul recomandat pentru sarcinile de lucru Hive interactive și iterative.
Lecția 3 • Pruning-ul partițiilor și împingerea predicatelor
Asigură că interogările scanează doar partițiile relevante și împing filtrele cât mai devreme. Aceste tehnici reduc I/O, care este costul dominant în interogările Hive.
Lecția 4 • Optimizarea formatelor de fișiere și compresiei
Selectează ORC și Parquet cu codecuri de compresie adecvate pentru a minimiza timpul de scanare. Compresia reduce atât costul de stocare, cât și I/O-ul de rețea în timpul execuției interogărilor.
Lecția 5 • Vectorizarea și optimizatorul bazat pe cost
Activează execuția vectorizată a interogărilor și optimizatorul bazat pe cost (CBO) pentru îmbunătățirea automată a planurilor. Ambele necesită colectarea de statistici pentru a funcționa corect.
Capitolul 7AscundeAscunde detaliiVezi detaliiFuncții definite de utilizator și extensibilitate
Funcții definite de utilizator și extensibilitate
Lecția 1 • Funcții de tabel definite de utilizator
Construiește UDTF-uri care emit mai multe rânduri dintr-un singur rând de intrare folosind interfața UDTF. UDTF-urile sprijină desfășurarea structurilor încastrate și generarea personalizată de rânduri.
Lecția 2 • Funcții de agregare definite de utilizator
Implementează UDAF-uri folosind interfețele UDAF și GenericUDAF pentru agregări personalizate. UDAF-urile operează pe grupuri de reducători și necesită gestionarea bufferelor.
Lecția 3 • Fundamentele dezvoltării UDF
Acoperă clasa de bază UDF, metoda evaluate și împachetarea JAR pentru funcții scalare simple. UDF-urile umplu golurile acolo unde funcțiile încorporate sunt insuficiente.
Lecția 4 • Transformări bazate pe scripturi Python
Folosește TRANSFORM și scripturi streaming pentru a aplica logică Python sau shell în HiveQL. Transformările prin scripturi permit prototiparea rapidă fără compilare Java.
Capitolul 8AscundeAscunde detaliiVezi detaliiHive în producție: securitate și guvernanță
Hive în producție: securitate și guvernanță
Lecția 1 • Gestionarea metastore-ului și disponibilitate înaltă
Configurează un metastore la distanță cu un backend relațional și o configurare de disponibilitate înaltă. Fiabilitatea metastore-ului este esențială pentru serviciul Hive neîntrerupt în producție.
Lecția 2 • Modele de autorizare: standarde SQL și Ranger
Compară autorizarea standard SQL a lui Hive cu controlul bazat pe politici al Apache Ranger. Autorizarea granulară impune accesul cu privilegii minime la nivel de coloană.
Lecția 3 • Autentificare și integrare Kerberos
Configurează autentificarea bazată pe Kerberos pentru HiveServer2 și conexiunile client. Autentificarea previne accesul neautorizat la activele de date sensibile.
Lecția 4 • Mascarea datelor și criptarea
Aplică politici de mascare dinamică a datelor și zone de criptare HDFS pentru a proteja coloanele sensibile. Mascarea permite analiza datelor sensibile fără a expune valorile brute.
Lecția 5 • Audit și înregistrare conformitate
Activează jurnalele de audit ale interogărilor prin HiveServer2 și pistele de audit Apache Ranger. Jurnalele de audit îndeplinesc cerințele de conformitate normativă pentru urmărirea accesului la date.
Certificatul tău valid de finalizare
Acest curs este pentru tine:
Analiști de date pregătiți să își extindă competențele dincolo de foi de calcul și SQL.
Ingineri de software care fac tranziția către roluri în big data și sisteme distribuite.
Dezvoltatori ETL care doresc să modernizeze pipeline-urile folosind unelte bazate pe Hadoop.
Administratori de baze de date care explorează stocarea coloane și reglarea interogărilor la scară largă.
Profesioniști în business intelligence ale căror seturi de date au depășit capacitățile bazelor de date relaționale.
Ingineri cloud însărcinați cu construirea sau migrarea infrastructurii de depozit de date.
Ce spun cursanții noștri
Lecțiile dumneavoastră sunt perfecte. Am achiziționat pachetul de un an și, în sfârșit, am oportunitatea să urmăresc diverse subiecte de interes fără să fie nevoie să schimb platforma... vă mulțumesc pentru tot ceea ce faceți, v-am recomandat deja altor persoane...

Îmi place cum lecțiile sunt directe la subiect și cum pot să schimb capitolele și să sar peste conținutul de care nu am nevoie.

Îmi place conținutul și modul de prezentare și transcriere a videoclipurilor, ceea ce accelerează procesul!

Platforma este rapidă, simplă de utilizat. Diversitatea conținutului și videoclipurile complementare ajută foarte mult la învățare.

Cele mai importante formări
Întrebări frecvente
Cine este Dedika?
Este certificatul valabil în România?
Cursurile sunt gratuite?
Care este volumul de muncă al cursului?
Cum sunt cursurile?
Cum funcționează cursurile?
Care este durata cursurilor?
Care este costul sau prețul cursurilor?
Ce este un curs EAD sau online și cum funcționează?
Curs PDF




















