Alegeți limba dvs.
Curs de interogare și optimizare Apache Hive
Peste 2 milioane de cursanți în întreaga lume

Curs de interogare și optimizare Apache Hive

Stăpânește Apache Hive de la zero — proiectând scheme, scriind interogări HiveQL puternice și ajustând performanța pe seturi masive de date. Acest curs acoperă totul, de la fundamentele HDFS și tranzacțiile ACID până la deployment în cloud, securitate și orchestrarea fluxurilor de lucru. Indiferent dacă construiești pipeline-uri de date enterprise sau optimizezi un data lakehouse, vei dobândi abilitățile practice pe care mediile de producție le cer.

Dedika pentru companii

Ce vei învăța:

  • Proiectați tabele Hive gestionate și externe cu partiționare, bucketizare și formate de stocare columnare.

  • Scrieți interogări HiveQL avansate folosind funcții de fereastră, CTE-uri, subinterogări și join-uri pe mai multe tabele.

  • Optimizați execuția interogărilor prin aplicarea prunerii partițiilor, vectorizării și ajustării optimizatorului bazat pe costuri.

  • Implementați securitatea Hive folosind autentificare Kerberos, politici Apache Ranger și mascare dinamică a datelor.

  • Integrați Hive cu Apache Spark, stocare în obiecte cloud și formate de tabele deschise precum Apache Iceberg.

  • Automatizați pipeline-urile de date cu Apache Airflow și Oozie, inclusiv încărcare incrementală și verificări de calitate.

Cum studiezi practic Curs de interogare și optimizare Apache Hive

Cum exersezi Curs de interogare și optimizare Apache Hive

Pentru tine, care reprezinți o companie și vrei să îți instruiești echipa

La Dedika pentru companii, cursul vine cu exerciții și exemple adaptate afacerii tale și exact așa cum are nevoie compania ta.

Apasă aici

Conținutul cursului

8 Capitole • 37 LecțiiDurata între 4 și 360 ore (tu decizi)

Capitolul 1Vezi detalii

Introducere în Big Data și Hive

  • Lecția 1 • Arhitectura și componentele Hive

    Explică componentele de bază ale lui Hive: metastore, driver, compilator și motor de execuție. Leagă arhitectura de înțelegerea ciclului de viață al unei interogări.

  • Lecția 2 • Fundamentele Big Data și provocările

    Acoperă provocările legate de volum, viteză și varietate care determină adoptarea big data. Stabilește contextul pentru existența uneltelor de procesare distribuită precum Hive.

  • Lecția 3 • Configurarea unui mediu Hive

    Ghidează instalarea și configurarea unui mediu Hive local sau sandbox. Oferă pregătire practică pentru toate capitolele următoare.

  • Lecția 4 • Hive versus baze de date tradiționale

    Contrastează modelul schema-on-read al lui Hive cu schema-on-write al RDBMS. Cursanții înțeleg când Hive este adecvat versus alternativele relaționale.

Capitolul 2Vezi detalii

Fundamentele HiveQL și tipurile de date

  • Lecția 1 • Tipuri de date primitive și complexe

    Acoperă tipurile numerice, șir, boolean și dată primitive, alături de tipurile complexe ARRAY, MAP și STRUCT. Selectarea corectă a tipului afectează stocarea și acuratețea interogărilor.

  • Lecția 2 • Sintaxa HiveQL și structura interogării

    Introduce HiveQL ca dialect SQL cu extensii specifice Hive. Acoperă clauzele SELECT, FROM, WHERE și ORDER BY ca elemente de bază.

  • Lecția 3 • Agregare și grupare

    Predă GROUP BY, HAVING și funcții de agregare pentru sumarizarea seturilor de date. Agregarea este fundamentală pentru modelele de interogări analitice utilizate pe parcursul cursului.

  • Lecția 4 • Subinterogări și expresii de tabel comune

    Introduce vizualizări inline, subinterogări și CTE-uri cu clauza WITH pentru proiectarea modulară a interogărilor. Aceste modele apar în interogări analitice complexe în capitolele ulterioare.

  • Lecția 5 • Funcții și operatori încorporați

    Prezintă funcțiile încorporate pentru șiruri, matematică, dată și condiționale. Cursanții aplică funcții pentru a transforma și evalua date în cadrul interogărilor.

Capitolul 3Vezi detalii

Proiectarea bazelor de date și tabelelor în Hive

  • Lecția 1 • Partiționarea tabelelor

    Predă partiționarea statică și dinamică pentru a reduce scanările complete ale tabelelor. Partiționarea este tehnica principală pentru îmbunătățirea performanței interogărilor pe tabele mari.

  • Lecția 2 • Crearea și gestionarea bazelor de date

    Acoperă CREATE DATABASE, DROP DATABASE și proprietățile bazelor de date. Organizarea corectă a bazelor de date sprijină guvernanța datelor în medii multi-echipă.

  • Lecția 3 • Formate de stocare a tabelelor

    Compară formatele de stocare TextFile, SequenceFile, ORC și Parquet. Alegerea formatului afectează direct viteza interogărilor și eficiența stocării.

  • Lecția 4 • Tabele gestionate versus tabele externe

    Distinge între tabelele gestionate (date deținute de Hive) și tabelele externe (date deținute de utilizator). Alegerea corectă previne pierderea accidentală a datelor.

  • Lecția 5 • Bucketing și grupare (clustering)

    Introduce bucketing-ul ca o completare a partiționării pentru o distribuție uniformă a datelor. Tabelele bucketate permit eșantionarea eficientă și optimizarea join-urilor.

Capitolul 4Vezi detalii

Încărcarea, inserarea și gestionarea datelor

  • Lecția 1 • Încărcarea datelor din fișiere

    Acoperă LOAD DATA LOCAL și LOAD DATA din căi HDFS. Încărcarea bazată pe fișiere este cel mai comun model de ingerare inițială în fluxurile de lucru Hive.

  • Lecția 2 • Tranzacțiile ACID și operațiile CRUD

    Explică suportul ACID al lui Hive care permite UPDATE și DELETE pe tabele ORC. Operațiile ACID necesită o configurare specifică și proprietăți de tabel.

  • Lecția 3 • Modele INSERT și INSERT OVERWRITE

    Predă INSERT INTO și INSERT OVERWRITE pentru popularea datelor bazată pe interogări. Aceste modele sprijină pipeline-urile ETL construite exclusiv în HiveQL.

  • Lecția 4 • Exportarea și arhivarea datelor

    Acoperă INSERT OVERWRITE DIRECTORY și comenzile EXPORT/IMPORT. Exportul datelor sprijină consumul în aval și migrarea între clustere.

Capitolul 5Vezi detalii

Join-uri, uniuni și interogări avansate

  • Lecția 1 • Join-uri asimetrice (skew joins) și gestionarea distribuției neuniforme a datelor (data skew)

    Abordează skew-ul join-urilor cauzat de valorile cheie de înaltă frecvență care supraîncarcă reducătorii. Optimizarea skew join distribuie cheile fierbinți în mai multe task-uri.

  • Lecția 2 • Tipuri de join-uri și sintaxă

    Acoperă join-urile INNER, LEFT, RIGHT, FULL OUTER și CROSS cu sintaxa HiveQL. Înțelegerea semanticii join-urilor previne seturile de rezultate incorecte.

  • Lecția 3 • UNION, INTERSECT și EXCEPT

    Predă operațiile pe seturi pentru combinarea și compararea seturilor de rezultate între interogări. Aceste operații sprijină modelele de deduplicare și analiză diferențială.

  • Lecția 4 • Join-uri map-side și broadcast

    Explică join-urile map-side folosind sugestia MAPJOIN pentru optimizarea tabelelor mici. Join-urile broadcast elimină costul shuffle-ului în join-urile între un tabel mare și unul mic.

  • Lecția 5 • Funcții fereastră și analitice

    Introduce OVER, PARTITION BY și ORDER BY pentru clasamente și agregări rulante. Funcțiile fereastră permit analize avansate fără a pierde granularitatea rândurilor.

Capitolul 6Vezi detalii

Tehnici de optimizare a interogărilor

  • Lecția 1 • Înțelegerea planului de execuție a interogării

    Folosește EXPLAIN și EXPLAIN EXTENDED pentru a interpreta planurile de execuție MapReduce și Tez. Citirea planurilor este abilitatea prealabilă esențială pentru toate deciziile de optimizare.

  • Lecția 2 • Ajustarea motorului de execuție Tez

    Configurează execuția DAG Tez pentru o latență redusă comparativ cu MapReduce. Tez este motorul recomandat pentru sarcinile de lucru Hive interactive și iterative.

  • Lecția 3 • Pruning-ul partițiilor și împingerea predicatelor

    Asigură că interogările scanează doar partițiile relevante și împing filtrele cât mai devreme. Aceste tehnici reduc I/O, care este costul dominant în interogările Hive.

  • Lecția 4 • Optimizarea formatelor de fișiere și compresiei

    Selectează ORC și Parquet cu codecuri de compresie adecvate pentru a minimiza timpul de scanare. Compresia reduce atât costul de stocare, cât și I/O-ul de rețea în timpul execuției interogărilor.

  • Lecția 5 • Vectorizarea și optimizatorul bazat pe cost

    Activează execuția vectorizată a interogărilor și optimizatorul bazat pe cost (CBO) pentru îmbunătățirea automată a planurilor. Ambele necesită colectarea de statistici pentru a funcționa corect.

Capitolul 7Vezi detalii

Funcții definite de utilizator și extensibilitate

  • Lecția 1 • Funcții de tabel definite de utilizator

    Construiește UDTF-uri care emit mai multe rânduri dintr-un singur rând de intrare folosind interfața UDTF. UDTF-urile sprijină desfășurarea structurilor încastrate și generarea personalizată de rânduri.

  • Lecția 2 • Funcții de agregare definite de utilizator

    Implementează UDAF-uri folosind interfețele UDAF și GenericUDAF pentru agregări personalizate. UDAF-urile operează pe grupuri de reducători și necesită gestionarea bufferelor.

  • Lecția 3 • Fundamentele dezvoltării UDF

    Acoperă clasa de bază UDF, metoda evaluate și împachetarea JAR pentru funcții scalare simple. UDF-urile umplu golurile acolo unde funcțiile încorporate sunt insuficiente.

  • Lecția 4 • Transformări bazate pe scripturi Python

    Folosește TRANSFORM și scripturi streaming pentru a aplica logică Python sau shell în HiveQL. Transformările prin scripturi permit prototiparea rapidă fără compilare Java.

Capitolul 8Vezi detalii

Hive în producție: securitate și guvernanță

  • Lecția 1 • Gestionarea metastore-ului și disponibilitate înaltă

    Configurează un metastore la distanță cu un backend relațional și o configurare de disponibilitate înaltă. Fiabilitatea metastore-ului este esențială pentru serviciul Hive neîntrerupt în producție.

  • Lecția 2 • Modele de autorizare: standarde SQL și Ranger

    Compară autorizarea standard SQL a lui Hive cu controlul bazat pe politici al Apache Ranger. Autorizarea granulară impune accesul cu privilegii minime la nivel de coloană.

  • Lecția 3 • Autentificare și integrare Kerberos

    Configurează autentificarea bazată pe Kerberos pentru HiveServer2 și conexiunile client. Autentificarea previne accesul neautorizat la activele de date sensibile.

  • Lecția 4 • Mascarea datelor și criptarea

    Aplică politici de mascare dinamică a datelor și zone de criptare HDFS pentru a proteja coloanele sensibile. Mascarea permite analiza datelor sensibile fără a expune valorile brute.

  • Lecția 5 • Audit și înregistrare conformitate

    Activează jurnalele de audit ale interogărilor prin HiveServer2 și pistele de audit Apache Ranger. Jurnalele de audit îndeplinesc cerințele de conformitate normativă pentru urmărirea accesului la date.

Certificare

Certificatul tău valid de finalizare

Acest curs este pentru tine:

  • Analiști de date pregătiți să își extindă competențele dincolo de foi de calcul și SQL.

  • Ingineri de software care fac tranziția către roluri în big data și sisteme distribuite.

  • Dezvoltatori ETL care doresc să modernizeze pipeline-urile folosind unelte bazate pe Hadoop.

  • Administratori de baze de date care explorează stocarea coloane și reglarea interogărilor la scară largă.

  • Profesioniști în business intelligence ale căror seturi de date au depășit capacitățile bazelor de date relaționale.

  • Ingineri cloud însărcinați cu construirea sau migrarea infrastructurii de depozit de date.

Ce spun cursanții noștri

Lecțiile dumneavoastră sunt perfecte. Am achiziționat pachetul de un an și, în sfârșit, am oportunitatea să urmăresc diverse subiecte de interes fără să fie nevoie să schimb platforma... vă mulțumesc pentru tot ceea ce faceți, v-am recomandat deja altor persoane...
Giulio Carlo
Giulio CarloStudent Marketing Digital
Îmi place cum lecțiile sunt directe la subiect și cum pot să schimb capitolele și să sar peste conținutul de care nu am nevoie.
Mariana Ferres
Mariana FerresStudentă Fotografie
Îmi place conținutul și modul de prezentare și transcriere a videoclipurilor, ceea ce accelerează procesul!
Luciana Alvarenga
Luciana AlvarengaStudentă Design Unghii
Platforma este rapidă, simplă de utilizat. Diversitatea conținutului și videoclipurile complementare ajută foarte mult la învățare.
André Felipe
André FelipeStudent Inginerie Prompt

Cele mai importante formări

Întrebări frecvente

Cine este Dedika?

Este certificatul valabil în România?

Cursurile sunt gratuite?

Care este volumul de muncă al cursului?

Cum sunt cursurile?

Cum funcționează cursurile?

Care este durata cursurilor?

Care este costul sau prețul cursurilor?

Ce este un curs EAD sau online și cum funcționează?

Curs PDF