Válassza ki a nyelvét
Apache Hive Big Data tanfolyam
Több mint 2 millió diák világszerte

Apache Hive Big Data tanfolyam

Sajátítsa el az Apache Hive-ot az alapoktól kezdve: sémák tervezése, hatékony HiveQL-lekérdezések írása és teljesítményhangolás hatalmas adathalmazokon. Ez a kurzus mindent lefed a HDFS-alapoktól és az ACID-tranzakcióktól kezdve a felhőbe történő telepítésen, a biztonságon és a munkafolyamat-orkesztráláson át. Akár vállalati adatfolyamatokat épít, akár adattóházat optimalizál, megszerzi azokat a gyakorlati készségeket, amelyeket a termelési környezetek megkövetelnek.

Dedika vállalatoknak

Mit fogsz megtanulni:

  • Kezelt és külső Hive-táblák tervezése particionálással, bucketinggel és oszlopos tárolási formátumokkal.

  • Írjon fejlett HiveQL-lekérdezéseket ablakfüggvények, CTE-k, alkérdések és többtáblás illesztések segítségével.

  • Optimalizálja a lekérdezések végrehajtását a partíciókivágás, a vektorizálás és a költség alapú optimalizáló hangolásának alkalmazásával.

  • Valósítsa meg a Hive biztonságát Kerberos hitelesítés, Apache Ranger szabályzatok és dinamikus adatmaszkolás használatával.

  • Integrálja a Hive-ot Apache Sparkkal, felhőalapú objektumtárolóval és nyílt táblaformátumokkal, mint az Apache Iceberg.

  • Automatizálja az adatfolyamatokat Apache Airflow és Oozie segítségével, beleértve a növekményes betöltést és a minőségi ellenőrzéseket.

Hogyan tanulhatsz gyakorlatiasan Apache Hive Big Data tanfolyam

Hogyan gyakorolsz Apache Hive Big Data tanfolyam

Önnek, ha vállalatként szeretné képezni a csapatát

A Dedika vállalatoknak szóló képzésein a tanfolyam saját üzleti példákkal és gyakorlatokkal, az Ön cégének igényeihez igazítva érhető el.

Kattintson ide

A kurzus tartalma

8 Fejezet • 37 Óra4 és 360 óra közötti időtartam (te döntesz)

1. fejezetRészletek megtekintése

Bevezetés a Big Data és a Hive világába

  • 1. óra • A Hive architektúrája és összetevői

    Ismerteti a Hive alapvető összetevőit: a metaadattárolót, a meghajtót, a fordítóprogramot és a végrehajtómotort. Összekapcsolja az architektúrát a lekérdezés életciklusának megértésével.

  • 2. óra • A big data alapjai és kihívásai

    Lefedi a big data bevezetését ösztönző volumen-, sebesség- és változatossági kihívásokat. Kontextust teremt arra, hogy miért léteznek olyan elosztott feldolgozó eszközök, mint a Hive.

  • 3. óra • Hive környezet beállítása

    Útmutató egy helyi vagy sandbox Hive környezet telepítéséhez és konfigurálásához. Gyakorlati felkészültséget biztosít az összes további fejezethez.

  • 4. óra • Hive vs. hagyományos adatbázisok

    Szembeállítja a Hive séma-olvasáskor modelljét az RDBMS séma-íráskor modelljével. A hallgatók megértik, mikor megfelelő a Hive a relációs alternatívákhoz képest.

2. fejezetRészletek megtekintése

A HiveQL alapjai és adattípusok

  • 1. óra • Primitive és összetett adattípusok

    Lefedi a numerikus, string, logikai és dátum primitíveket az ARRAY, MAP és STRUCT összetett típusok mellett. A helyes típusválasztás befolyásolja a tárolást és a lekérdezés pontosságát.

  • 2. óra • HiveQL szintaxis és lekérdezés szerkezet

    Bemutatja a HiveQL-t mint SQL dialektust Hive-specifikus kiterjesztésekkel. Lefedi a SELECT, FROM, WHERE és ORDER BY klauzulákat mint építőelemeket.

  • 3. óra • Aggregálás és csoportosítás

    Megtanítja a GROUP BY, HAVING és aggregát függvények használatát adathalmazok összegzésére. Az aggregálás alapvető az analitikus lekérdezési mintákhoz, amelyeket a kurzus során használnak.

  • 4. óra • Allekérdezések és közös táblakifejezések

    Bevezeti a beágyazott nézeteket, allekérdezéseket és a WITH klauzula CTE-it a moduláris lekérdezés-tervezéshez. Ezek a minták összetett analitikus lekérdezésekben jelennek meg a későbbi fejezetekben.

  • 5. óra • Beépített függvények és operátorok

    Áttekinti a string, matematikai, dátum és feltételes beépített függvényeket. A hallgatók függvényeket alkalmaznak az adatok átalakítására és kiértékelésére a lekérdezéseken belül.

3. fejezetRészletek megtekintése

Adatbázis és tábla tervezés a Hive-ban

  • 1. óra • Táblák particionálása

    Megtanítja a statikus és dinamikus particionálást a teljes tábla átvizsgálások csökkentésére. A particionálás az elsődleges technika a lekérdezési teljesítmény javítására nagy táblákon.

  • 2. óra • Adatbázisok létrehozása és kezelése

    Lefedi a CREATE DATABASE, DROP DATABASE parancsokat és az adatbázis tulajdonságokat. A megfelelő adatbázis-szervezés támogatja a több csapatos adatirányítást.

  • 3. óra • Tábla tárolási formátumok

    Összehasonlítja a TextFile, SequenceFile, ORC és Parquet tárolási formátumokat. A formátumválasztás közvetlenül befolyásolja a lekérdezés sebességét és a tárolás hatékonyságát.

  • 4. óra • Kezelt vs. külső táblák

    Megkülönbözteti a kezelt táblákat (Hive által birtokolt adatok) a külső tábláktól (felhasználó által birtokolt adatok). A helyes választás megakadályozza a véletlen adatvesztést.

  • 5. óra • Bucketelés és clusterelés

    Bevezeti a bucketelést mint a particionálás kiegészítőjét az egyenletes adatelosztáshoz. A bucketelt táblák lehetővé teszik a hatékony mintavételezést és kapcsolás optimalizálást.

4. fejezetRészletek megtekintése

Adatok betöltése, beszúrása és kezelése

  • 1. óra • Adatok betöltése fájlokból

    Lefedi a LOAD DATA LOCAL és a LOAD DATA HDFS elérési utakról történő használatát. A fájl alapú betöltés a leggyakoribb kezdeti adatbeviteli minta a Hive munkafolyamatokban.

  • 2. óra • ACID tranzakciók és CRUD műveletek

    Elmagyarázza a Hive ACID támogatását, amely lehetővé teszi az UPDATE és DELETE parancsok használatát ORC táblákon. Az ACID műveletek speciális konfigurációt és tábla tulajdonságokat igényelnek.

  • 3. óra • INSERT és INSERT OVERWRITE minták

    Megtanítja az INSERT INTO és INSERT OVERWRITE használatát lekérdezés-vezérelt adatpopulációhoz. Ezek a minták támogatják a kizárólag HiveQL-ben épített ETL folyamatokat.

  • 4. óra • Adatok exportálása és archiválása

    Lefedezi az INSERT OVERWRITE DIRECTORY és az EXPORT/IMPORT parancsokat. Az adatexport támogatja a downstream felhasználást és a fürtök közötti migrációt.

5. fejezetRészletek megtekintése

Kapcsolások, uniók és haladó lekérdezés

  • 1. óra • Ferde kapcsolások és adatferdeség kezelés

    A nagy gyakoriságú kulcsértékek által okozott kapcsolási ferdeséggel foglalkozik, amelyek túlterhelik a reducereket. A ferde kapcsolás optimalizálás elosztja a forró kulcsokat több feladat között.

  • 2. óra • Kapcsolási típusok és szintaxis

    Lefedi az INNER, LEFT, RIGHT, FULL OUTER és CROSS kapcsolásokat HiveQL szintaxissal. A kapcsolási szemantika megértése megakadályozza a helytelen eredményhalmazokat.

  • 3. óra • UNION, INTERSECT és EXCEPT

    Megtanítja a halmazműveleteket eredményhalmazok kombinálására és összehasonlítására lekérdezésekben. Ezek a műveletek támogatják a deduplikációs és differenciális elemzési mintákat.

  • 4. óra • Map-oldali és szórásos kapcsolások

    Elmagyarázza a map-oldali kapcsolásokat a MAPJOIN utalás használatával kis táblák optimalizálására. A szórásos kapcsolások kiküszöbölik a shuffle overheadet a nagy tábla és kis tábla közötti kapcsolásokban.

  • 5. óra • Ablakfüggvények és analitika

    Bevezeti az OVER, PARTITION BY és ORDER BY használatát rangsoroláshoz és futó aggregációkhoz. Az ablakfüggvények lehetővé teszik a haladó analitikát a sor granularitásának összeomlása nélkül.

6. fejezetRészletek megtekintése

Lekérdezés-optimalizálási technikák

  • 1. óra • A lekérdezés végrehajtási tervének megértése

    Az EXPLAIN és EXPLAIN EXTENDED használata a MapReduce és Tez végrehajtási tervek értelmezéséhez. A tervek olvasása az előfeltétele minden optimalizálási döntésnek.

  • 2. óra • Tez végrehajtó motor hangolás

    A Tez DAG végrehajtás konfigurálása a kisebb késleltetés érdekében a MapReduce-hoz képest. A Tez az ajánlott motor interaktív és iteratív Hive munkaterhelésekhez.

  • 3. óra • Partíció metszés és predikátum lenyomás

    Biztosítja, hogy a lekérdezések csak a releváns partíciókat vizsgálják át, és a szűrőket a lehető legkorábban lenyomják. Ezek a technikák csökkentik az I/O-t, ami a domináns költség a Hive lekérdezésekben.

  • 4. óra • Fájlformátum és tömörítés optimalizálás

    Válassza az ORC-t és a Parquet-t a megfelelő tömörítési kodekkel a beolvasási idő minimalizálása érdekében. A tömörítés csökkenti a tárolási költséget és a hálózati I/O-t a lekérdezés végrehajtása során.

  • 5. óra • Vektorizáció és költségalapú optimalizáló

    Engedélyezi a vektorizált lekérdezés végrehajtást és a költségalapú optimalizálót (CBO) az automatikus tervjavításhoz. Mindkettő statisztikagyűjtést igényel a helyes működéshez.

7. fejezetRészletek megtekintése

Felhasználó által definiált függvények és bővíthetőség

  • 1. óra • Felhasználó által definiált táblafüggvények

    UDTF-eket épít, amelyek több sort állítanak elő egyetlen bemeneti sorból az UDTF interfész segítségével. Az UDTF-ek támogatják a beágyazott struktúrák kibontását és egyéni sor generálást.

  • 2. óra • Felhasználó által definiált aggregát függvények

    UDAF-eket valósít meg az UDAF és GenericUDAF interfészek segítségével egyéni aggregációkhoz. Az UDAF-ek reducer csoportokon át működnek, és puffer kezelést igényelnek.

  • 3. óra • UDF fejlesztés alapjai

    Lefedi az UDF alaposztályt, az evaluate metódust és a JAR csomagolást egyszerű skalár függvényekhez. Az UDF-ek kitöltik a hiányosságokat, ahol a beépített függvények nem elegendőek.

  • 4. óra • Python és szkript alapú transzformációk

    A TRANSFORM és a streaming szkriptek használata Python vagy shell logika alkalmazására a HiveQL-en belül. A szkript transzformációk lehetővé teszik a gyors prototípus készítést Java fordítás nélkül.

8. fejezetRészletek megtekintése

Hive éles környezetben: biztonság és irányítás

  • 1. óra • Metastore kezelés és magas rendelkezésre állás

    Konfigurál egy távoli metastore-t relációs háttérrendszerrel és magas rendelkezésre állású beállítással. A metastore megbízhatósága kritikus a megszakítás nélküli Hive szolgáltatáshoz éles környezetben.

  • 2. óra • Engedélyezési modellek: SQL szabványok és Ranger

    Összehasonlítja a Hive SQL szabvány engedélyezést az Apache Ranger szabályzatalapú vezérlésével. A részletes engedélyezés kikényszeríti a legkisebb jogosultság elvét oszlop szinten.

  • 3. óra • Hitelesítés és Kerberos integráció

    Konfigurálja a Kerberos alapú hitelesítést a HiveServer2 és a kliens kapcsolatok számára. A hitelesítés megakadályozza a jogosulatlan hozzáférést az érzékeny adatvagyonhoz.

  • 4. óra • Adatmaszkolás és titkosítás

    Dinamikus adatmaszkolási szabályzatokat és HDFS titkosítási zónákat alkalmaz az érzékeny oszlopok védelmére. A maszkolás lehetővé teszi az elemzést érzékeny adatokon anélkül, hogy felfedné a nyers értékeket.

  • 5. óra • Auditálás és megfelelőségi naplózás

    Lekérdezési audit naplók engedélyezése a HiveServer2 és az Apache Ranger audit nyomvonalain keresztül. Az audit naplók kielégítik a szabályozási megfelelőségi követelményeket az adathozzáférés nyomon követésére.

Tanúsítvány

Érvényes befejezési tanúsítványod

Ez a kurzus neked szól:

  • Adatelemzők, akik készen állnak a táblázatkezelőkön és SQL-en túlmutató készségeik fejlesztésére.

  • Szoftvermérnökök, akik a big data és az elosztott rendszerek szerepkörei felé kívánnak váltani.

  • ETL-fejlesztők, akik modernizálni szeretnék adatfolyamataikat Hadoop-alapú eszközökkel.

  • Adatbázis-adminisztrátorok, akik oszlopos tárolást és nagyméretű lekérdezések hangolását vizsgálják.

  • Üzleti intelligencia szakemberek, akiknek adathalmazai kinőtték a relációs adatbázisokat.

  • Felhőmérnökök, akiknek adattárház-infrastruktúrát kell felépíteniük vagy migrálniuk.

Mit mondanak a diákjaink

Az órái tökéletesek. Megvettem az egyéves csomagot, és végre lehetőségem van különböző érdekes témákat követni anélkül, hogy platformot kellene váltanom... köszönöm mindazt, amit csinálnak, már ajánlottam is másoknak...
Giulio Carlo
Giulio CarloDigitális Marketing Hallgató
Szeretem, hogy a leckék egyenesen a lényegre térnek, és hogy tudok fejezeteket váltani és átugrani olyan tartalmakat, amikre nincs szükségem.
Mariana Ferres
Mariana FerresFotográfia Hallgató
Szeretem a tartalmat és a videók bemutatási és átírási módját, ami felgyorsítja a folyamatot!
Luciana Alvarenga
Luciana AlvarengaKörömdesign Hallgató
A platform gyors, egyszerű használni. A tartalom sokfélesége és a kiegészítő videók nagyon sokat segítenek a tanulásban.
André Felipe
André FelipePrompt Engineering Hallgató

Főbb képzések

GYIK

Mi a Dedika?

Érvényes a tanúsítvány Magyarországon?

Ingyenesek a tanfolyamok?

Mennyi a tanfolyamok óraszáma?

Milyenek a tanfolyamok?

Hogyan működnek a tanfolyamok?

Mennyi ideig tartanak a tanfolyamok?

Mennyibe kerülnek a tanfolyamok?

Mi az az EAD vagy online tanfolyam, és hogyan működik?

PDF tanfolyam