
Apache Hive Big Data tanfolyam
Sajátítsa el az Apache Hive-ot az alapoktól kezdve: sémák tervezése, hatékony HiveQL-lekérdezések írása és teljesítményhangolás hatalmas adathalmazokon. Ez a kurzus mindent lefed a HDFS-alapoktól és az ACID-tranzakcióktól kezdve a felhőbe történő telepítésen, a biztonságon és a munkafolyamat-orkesztráláson át. Akár vállalati adatfolyamatokat épít, akár adattóházat optimalizál, megszerzi azokat a gyakorlati készségeket, amelyeket a termelési környezetek megkövetelnek.
Mit fogsz megtanulni:
Kezelt és külső Hive-táblák tervezése particionálással, bucketinggel és oszlopos tárolási formátumokkal.
Írjon fejlett HiveQL-lekérdezéseket ablakfüggvények, CTE-k, alkérdések és többtáblás illesztések segítségével.
Optimalizálja a lekérdezések végrehajtását a partíciókivágás, a vektorizálás és a költség alapú optimalizáló hangolásának alkalmazásával.
Valósítsa meg a Hive biztonságát Kerberos hitelesítés, Apache Ranger szabályzatok és dinamikus adatmaszkolás használatával.
Integrálja a Hive-ot Apache Sparkkal, felhőalapú objektumtárolóval és nyílt táblaformátumokkal, mint az Apache Iceberg.
Automatizálja az adatfolyamatokat Apache Airflow és Oozie segítségével, beleértve a növekményes betöltést és a minőségi ellenőrzéseket.
Hogyan tanulhatsz gyakorlatiasan Apache Hive Big Data tanfolyam
Hogyan gyakorolsz Apache Hive Big Data tanfolyam
Önnek, ha vállalatként szeretné képezni a csapatát
A Dedika vállalatoknak szóló képzésein a tanfolyam saját üzleti példákkal és gyakorlatokkal, az Ön cégének igényeihez igazítva érhető el.
A kurzus tartalma
8 Fejezet • 37 Óra4 és 360 óra közötti időtartam (te döntesz)
1. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseBevezetés a Big Data és a Hive világába
Bevezetés a Big Data és a Hive világába
1. óra • A Hive architektúrája és összetevői
Ismerteti a Hive alapvető összetevőit: a metaadattárolót, a meghajtót, a fordítóprogramot és a végrehajtómotort. Összekapcsolja az architektúrát a lekérdezés életciklusának megértésével.
2. óra • A big data alapjai és kihívásai
Lefedi a big data bevezetését ösztönző volumen-, sebesség- és változatossági kihívásokat. Kontextust teremt arra, hogy miért léteznek olyan elosztott feldolgozó eszközök, mint a Hive.
3. óra • Hive környezet beállítása
Útmutató egy helyi vagy sandbox Hive környezet telepítéséhez és konfigurálásához. Gyakorlati felkészültséget biztosít az összes további fejezethez.
4. óra • Hive vs. hagyományos adatbázisok
Szembeállítja a Hive séma-olvasáskor modelljét az RDBMS séma-íráskor modelljével. A hallgatók megértik, mikor megfelelő a Hive a relációs alternatívákhoz képest.
2. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseA HiveQL alapjai és adattípusok
A HiveQL alapjai és adattípusok
1. óra • Primitive és összetett adattípusok
Lefedi a numerikus, string, logikai és dátum primitíveket az ARRAY, MAP és STRUCT összetett típusok mellett. A helyes típusválasztás befolyásolja a tárolást és a lekérdezés pontosságát.
2. óra • HiveQL szintaxis és lekérdezés szerkezet
Bemutatja a HiveQL-t mint SQL dialektust Hive-specifikus kiterjesztésekkel. Lefedi a SELECT, FROM, WHERE és ORDER BY klauzulákat mint építőelemeket.
3. óra • Aggregálás és csoportosítás
Megtanítja a GROUP BY, HAVING és aggregát függvények használatát adathalmazok összegzésére. Az aggregálás alapvető az analitikus lekérdezési mintákhoz, amelyeket a kurzus során használnak.
4. óra • Allekérdezések és közös táblakifejezések
Bevezeti a beágyazott nézeteket, allekérdezéseket és a WITH klauzula CTE-it a moduláris lekérdezés-tervezéshez. Ezek a minták összetett analitikus lekérdezésekben jelennek meg a későbbi fejezetekben.
5. óra • Beépített függvények és operátorok
Áttekinti a string, matematikai, dátum és feltételes beépített függvényeket. A hallgatók függvényeket alkalmaznak az adatok átalakítására és kiértékelésére a lekérdezéseken belül.
3. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseAdatbázis és tábla tervezés a Hive-ban
Adatbázis és tábla tervezés a Hive-ban
1. óra • Táblák particionálása
Megtanítja a statikus és dinamikus particionálást a teljes tábla átvizsgálások csökkentésére. A particionálás az elsődleges technika a lekérdezési teljesítmény javítására nagy táblákon.
2. óra • Adatbázisok létrehozása és kezelése
Lefedi a CREATE DATABASE, DROP DATABASE parancsokat és az adatbázis tulajdonságokat. A megfelelő adatbázis-szervezés támogatja a több csapatos adatirányítást.
3. óra • Tábla tárolási formátumok
Összehasonlítja a TextFile, SequenceFile, ORC és Parquet tárolási formátumokat. A formátumválasztás közvetlenül befolyásolja a lekérdezés sebességét és a tárolás hatékonyságát.
4. óra • Kezelt vs. külső táblák
Megkülönbözteti a kezelt táblákat (Hive által birtokolt adatok) a külső tábláktól (felhasználó által birtokolt adatok). A helyes választás megakadályozza a véletlen adatvesztést.
5. óra • Bucketelés és clusterelés
Bevezeti a bucketelést mint a particionálás kiegészítőjét az egyenletes adatelosztáshoz. A bucketelt táblák lehetővé teszik a hatékony mintavételezést és kapcsolás optimalizálást.
4. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseAdatok betöltése, beszúrása és kezelése
Adatok betöltése, beszúrása és kezelése
1. óra • Adatok betöltése fájlokból
Lefedi a LOAD DATA LOCAL és a LOAD DATA HDFS elérési utakról történő használatát. A fájl alapú betöltés a leggyakoribb kezdeti adatbeviteli minta a Hive munkafolyamatokban.
2. óra • ACID tranzakciók és CRUD műveletek
Elmagyarázza a Hive ACID támogatását, amely lehetővé teszi az UPDATE és DELETE parancsok használatát ORC táblákon. Az ACID műveletek speciális konfigurációt és tábla tulajdonságokat igényelnek.
3. óra • INSERT és INSERT OVERWRITE minták
Megtanítja az INSERT INTO és INSERT OVERWRITE használatát lekérdezés-vezérelt adatpopulációhoz. Ezek a minták támogatják a kizárólag HiveQL-ben épített ETL folyamatokat.
4. óra • Adatok exportálása és archiválása
Lefedezi az INSERT OVERWRITE DIRECTORY és az EXPORT/IMPORT parancsokat. Az adatexport támogatja a downstream felhasználást és a fürtök közötti migrációt.
5. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseKapcsolások, uniók és haladó lekérdezés
Kapcsolások, uniók és haladó lekérdezés
1. óra • Ferde kapcsolások és adatferdeség kezelés
A nagy gyakoriságú kulcsértékek által okozott kapcsolási ferdeséggel foglalkozik, amelyek túlterhelik a reducereket. A ferde kapcsolás optimalizálás elosztja a forró kulcsokat több feladat között.
2. óra • Kapcsolási típusok és szintaxis
Lefedi az INNER, LEFT, RIGHT, FULL OUTER és CROSS kapcsolásokat HiveQL szintaxissal. A kapcsolási szemantika megértése megakadályozza a helytelen eredményhalmazokat.
3. óra • UNION, INTERSECT és EXCEPT
Megtanítja a halmazműveleteket eredményhalmazok kombinálására és összehasonlítására lekérdezésekben. Ezek a műveletek támogatják a deduplikációs és differenciális elemzési mintákat.
4. óra • Map-oldali és szórásos kapcsolások
Elmagyarázza a map-oldali kapcsolásokat a MAPJOIN utalás használatával kis táblák optimalizálására. A szórásos kapcsolások kiküszöbölik a shuffle overheadet a nagy tábla és kis tábla közötti kapcsolásokban.
5. óra • Ablakfüggvények és analitika
Bevezeti az OVER, PARTITION BY és ORDER BY használatát rangsoroláshoz és futó aggregációkhoz. Az ablakfüggvények lehetővé teszik a haladó analitikát a sor granularitásának összeomlása nélkül.
6. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseLekérdezés-optimalizálási technikák
Lekérdezés-optimalizálási technikák
1. óra • A lekérdezés végrehajtási tervének megértése
Az EXPLAIN és EXPLAIN EXTENDED használata a MapReduce és Tez végrehajtási tervek értelmezéséhez. A tervek olvasása az előfeltétele minden optimalizálási döntésnek.
2. óra • Tez végrehajtó motor hangolás
A Tez DAG végrehajtás konfigurálása a kisebb késleltetés érdekében a MapReduce-hoz képest. A Tez az ajánlott motor interaktív és iteratív Hive munkaterhelésekhez.
3. óra • Partíció metszés és predikátum lenyomás
Biztosítja, hogy a lekérdezések csak a releváns partíciókat vizsgálják át, és a szűrőket a lehető legkorábban lenyomják. Ezek a technikák csökkentik az I/O-t, ami a domináns költség a Hive lekérdezésekben.
4. óra • Fájlformátum és tömörítés optimalizálás
Válassza az ORC-t és a Parquet-t a megfelelő tömörítési kodekkel a beolvasási idő minimalizálása érdekében. A tömörítés csökkenti a tárolási költséget és a hálózati I/O-t a lekérdezés végrehajtása során.
5. óra • Vektorizáció és költségalapú optimalizáló
Engedélyezi a vektorizált lekérdezés végrehajtást és a költségalapú optimalizálót (CBO) az automatikus tervjavításhoz. Mindkettő statisztikagyűjtést igényel a helyes működéshez.
7. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseFelhasználó által definiált függvények és bővíthetőség
Felhasználó által definiált függvények és bővíthetőség
1. óra • Felhasználó által definiált táblafüggvények
UDTF-eket épít, amelyek több sort állítanak elő egyetlen bemeneti sorból az UDTF interfész segítségével. Az UDTF-ek támogatják a beágyazott struktúrák kibontását és egyéni sor generálást.
2. óra • Felhasználó által definiált aggregát függvények
UDAF-eket valósít meg az UDAF és GenericUDAF interfészek segítségével egyéni aggregációkhoz. Az UDAF-ek reducer csoportokon át működnek, és puffer kezelést igényelnek.
3. óra • UDF fejlesztés alapjai
Lefedi az UDF alaposztályt, az evaluate metódust és a JAR csomagolást egyszerű skalár függvényekhez. Az UDF-ek kitöltik a hiányosságokat, ahol a beépített függvények nem elegendőek.
4. óra • Python és szkript alapú transzformációk
A TRANSFORM és a streaming szkriptek használata Python vagy shell logika alkalmazására a HiveQL-en belül. A szkript transzformációk lehetővé teszik a gyors prototípus készítést Java fordítás nélkül.
8. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseHive éles környezetben: biztonság és irányítás
Hive éles környezetben: biztonság és irányítás
1. óra • Metastore kezelés és magas rendelkezésre állás
Konfigurál egy távoli metastore-t relációs háttérrendszerrel és magas rendelkezésre állású beállítással. A metastore megbízhatósága kritikus a megszakítás nélküli Hive szolgáltatáshoz éles környezetben.
2. óra • Engedélyezési modellek: SQL szabványok és Ranger
Összehasonlítja a Hive SQL szabvány engedélyezést az Apache Ranger szabályzatalapú vezérlésével. A részletes engedélyezés kikényszeríti a legkisebb jogosultság elvét oszlop szinten.
3. óra • Hitelesítés és Kerberos integráció
Konfigurálja a Kerberos alapú hitelesítést a HiveServer2 és a kliens kapcsolatok számára. A hitelesítés megakadályozza a jogosulatlan hozzáférést az érzékeny adatvagyonhoz.
4. óra • Adatmaszkolás és titkosítás
Dinamikus adatmaszkolási szabályzatokat és HDFS titkosítási zónákat alkalmaz az érzékeny oszlopok védelmére. A maszkolás lehetővé teszi az elemzést érzékeny adatokon anélkül, hogy felfedné a nyers értékeket.
5. óra • Auditálás és megfelelőségi naplózás
Lekérdezési audit naplók engedélyezése a HiveServer2 és az Apache Ranger audit nyomvonalain keresztül. Az audit naplók kielégítik a szabályozási megfelelőségi követelményeket az adathozzáférés nyomon követésére.
Érvényes befejezési tanúsítványod
Ez a kurzus neked szól:
Adatelemzők, akik készen állnak a táblázatkezelőkön és SQL-en túlmutató készségeik fejlesztésére.
Szoftvermérnökök, akik a big data és az elosztott rendszerek szerepkörei felé kívánnak váltani.
ETL-fejlesztők, akik modernizálni szeretnék adatfolyamataikat Hadoop-alapú eszközökkel.
Adatbázis-adminisztrátorok, akik oszlopos tárolást és nagyméretű lekérdezések hangolását vizsgálják.
Üzleti intelligencia szakemberek, akiknek adathalmazai kinőtték a relációs adatbázisokat.
Felhőmérnökök, akiknek adattárház-infrastruktúrát kell felépíteniük vagy migrálniuk.
Mit mondanak a diákjaink
Az órái tökéletesek. Megvettem az egyéves csomagot, és végre lehetőségem van különböző érdekes témákat követni anélkül, hogy platformot kellene váltanom... köszönöm mindazt, amit csinálnak, már ajánlottam is másoknak...

Szeretem, hogy a leckék egyenesen a lényegre térnek, és hogy tudok fejezeteket váltani és átugrani olyan tartalmakat, amikre nincs szükségem.

Szeretem a tartalmat és a videók bemutatási és átírási módját, ami felgyorsítja a folyamatot!

A platform gyors, egyszerű használni. A tartalom sokfélesége és a kiegészítő videók nagyon sokat segítenek a tanulásban.

Főbb képzések
GYIK
Mi a Dedika?
Érvényes a tanúsítvány Magyarországon?
Ingyenesek a tanfolyamok?
Mennyi a tanfolyamok óraszáma?
Milyenek a tanfolyamok?
Hogyan működnek a tanfolyamok?
Mennyi ideig tartanak a tanfolyamok?
Mennyibe kerülnek a tanfolyamok?
Mi az az EAD vagy online tanfolyam, és hogyan működik?
PDF tanfolyam




















