Válassza ki a nyelvét
Databricks Data Engineering kurzus
Több mint 2 millió diák világszerte

Databricks Data Engineering kurzus

Sajátítsa el a teljes Databricks adattechnológiai stack-et – az Apache Spark alapjaitól és a Delta Lake architektúrától a gyártási szintű folyamatorchesztrációig és a vállalati irányításig. Ez a kurzus gyakorlati készségekkel ruházza fel, hogy megbízható, skálázható adatplatformokat tervezhessen, optimalizálhasson és üzemeltethessen. Akár most kezd az adattechnológiában, akár a tóházi szakértelmét szeretné továbbfejleszteni, ez a meghatározó Databricks-képzés.

Dedika vállalatoknak

Mit fogsz megtanulni:

  • Konfigurálja és kezelje hatékonyan a Databricks-fürtöket, munkaterületeket és számítási erőforrásokat.

  • Építsen skálázható ELT-folyamatokat az Auto Loader, a Structured Streaming és a medallion architektúra segítségével.

  • Valósítson meg Delta Lake-táblákat ACID-tranzakciókkal, időutazással és sémafejlesztéssel.

  • Hozzon létre deklaratív, öngyógyító folyamatokat Delta Live Tables segítségével, minőségi elvárásokkal.

  • Alkalmazzon fejlett Spark-hangolási technikákat, beleértve az AQE-t, a particionálási stratégiákat és a Photon motort.

  • Az enterprise szintű adatirányítás, hozzáférés-szabályozás és az adatok származásának nyomon követésének biztosítása a Unity Catalog használatával.

Hogyan tanulhatsz gyakorlatiasan Databricks Data Engineering kurzus

Hogyan gyakorolsz Databricks Data Engineering kurzus

Önnek, ha vállalatként szeretné képezni a csapatát

A Dedika vállalatoknak szóló képzésein a tanfolyam saját üzleti példákkal és gyakorlatokkal, az Ön cégének igényeihez igazítva érhető el.

Kattintson ide

A kurzus tartalma

8 Fejezet • 40 Óra4 és 360 óra közötti időtartam (te döntesz)

1. fejezetRészletek megtekintése

Databricks Platform Alapjai

  • 1. óra • Fürtkonfiguráció és -kezelés

    A fürtlétrehozás, -méretének meghatározása, automatikus skálázása és leállítási szabályzatainak oktatása. A hallgatók kezdetektől fogva kézben tartják a számítási költségeket és a teljesítményt.

  • 2. óra • Databricks Architektúra Áttekintése

    A Databrickset alátámasztó vezérlősík, adatsík és fürtarchitektúra ismertetése. Minden további platformhasználatot egy tiszta mentális modellbe ágyaz.

  • 3. óra • Munkaterület-navigáció és -beállítás

    A Databricks felhasználói felületének, mappaszerkezetének és felhasználói beállításainak bemutatása. Lehetővé teszi a hallgatók számára projektek szervezését és személyes környezeteik hatékony kezelését.

  • 4. óra • Databricks CLI és REST API Alapok

    A platform programozott elérésének bemutatása CLI-n és REST API-n keresztül. Felkészíti a hallgatókat a későbbi fejezetekben tárgyalt automatizálási feladatokra.

  • 5. óra • Jegyzetfüzetek és Együttműködésen Alapuló Fejlesztés

    A jegyzetfüzet-létrehozás, varázsparancsok és valós idejű együttműködési funkciók felfedezése. Kialakítja a kurzus során használt elsődleges fejlesztési felületet.

2. fejezetRészletek megtekintése

Apache Spark Alapfogalmak

  • 1. óra • Transzformációk és Akciók

    A keskeny és széles transzformációk megkülönböztetése és az akció kiváltó okainak magyarázata. A hallgatók megtanulják értelmezni a shuffle-költségeket és a végrehajtási határokat.

  • 2. óra • Spark Elosztott Végrehajtási Modell

    Az RDD-k, DAG-ok, szakaszok és feladatok magyarázata a Spark végrehajtási motorjában. A koncepcionális alapot nyújtja hatékony elosztott kód írásához.

  • 3. óra • DataFrame API Alapok

    A DataFrame-létrehozás, sémainferencia és alapvető transzformációk ismertetése. A hallgatók ezeket a műveleteket alkalmazzák elsődleges adatmanipulációs felületként.

  • 4. óra • Spark Teljesítmény Alapok

    A Spark felhasználói felületének, végrehajtási terveinek és alapvető hangolási lehetőségeinek bemutatása. Felkészíti a hallgatókat a gyakori teljesítmény-szűk keresztmetszetek diagnosztizálására és kezelésére.

  • 5. óra • Spark SQL és Katalógus

    SQL lekérdezések oktatása DataFrame-eken és a Spark katalógus használata metaadat-kezeléshez. Áthidalja az SQL ismereteket a programozott Spark használattal.

3. fejezetRészletek megtekintése

Delta Lake Architektúra és Műveletek

  • 1. óra • Delta Lake Tárolási Formátum

    A Delta Lake-et alkotó Parquet fájlok, tranzakciós napló és ellenőrzőpont-fájlok magyarázata. A hallgatók megértik, miért nyújt a Delta megbízhatóságot a nyers fájlformátumokkal szemben.

  • 2. óra • Delta Táblák Létrehozása és Kezelése

    DDL a Delta táblák létrehozásához, módosításához és törléséhez. Kialakítja az összes további adatfolyam-munkához szükséges táblakezelési készségeket.

  • 3. óra • ACID Tranzakciók és Konkurencia

    Optimista konkurencia-vezérlés, izolációs szintek és konfliktuskezelés oktatása a Deltában. A hallgatók olyan adatfolyamokat tervezhetnek, amelyek biztonságosan kezelik az egyidejű írási műveleteket.

  • 4. óra • Delta Lake Optimalizálási Technikák

    Az OPTIMIZE, Z-rendezés és fájltömörítés ismertetése a lekérdezési teljesítmény javítása érdekében. A hallgatók ezeket a technikákat alkalmazzák éles szintű Delta táblákra.

  • 5. óra • Időutazás és Adatverziózás

    Korábbi táblaverziók lekérdezésének és korábbi állapotok visszaállításának bemutatása. Lehetővé teszi a naplózási, visszaállítási és reprodukálhatósági mintákat az adatfolyamokban.

4. fejezetRészletek megtekintése

Adatbetöltés és ELT Minták

  • 1. óra • ELT Tervezési Minták

    A medallion architektúra és a növekményes betöltési stratégiák bemutatása strukturált ELT-hez. A hallgatók többlépcsős adatfolyamokat terveznek, amelyek elkülönítik a nyers, tisztított és összeállított rétegeket.

  • 2. óra • Kötegelt Betöltés Gyakori Forrásokból

    Olvasás oktatása felhőalapú objektumtárolóból, JDBC adatbázisokból és fájlformátumokból. Biztosítja a betöltési alapot a fejezet összes adatfolyam-mintájához.

  • 3. óra • Adatminőség Kikényszerítése Betöltéskor

    Megszorítás-alapú érvényesítés, karantén minták és elvárás keretrendszerek oktatása. Biztosítja, hogy az adatminőséget még azelőtt kikényszerítsék, mielőtt az adatok elérnék a downstream fogyasztókat.

  • 4. óra • Strukturált Streamelés Alapok

    A streamelt DataFrame-ek, triggerek és kimeneti módok ismertetése folyamatos adatfeldolgozáshoz. Összeköti a streamelt fogalmakat a termelésben használt Delta Lake desztinációval.

  • 5. óra • Automatikus Betöltő Növekményes Betöltéshez

    Az Automatikus Betöltő fájlértesítési és könyvtárlistázási módjának bemutatása skálázható növekményes betöltésekhez. A hallgatók konfigurálják az Automatikus Betöltő ellenőrzőpontját és sémafejlődését.

5. fejezetRészletek megtekintése

Delta Live Tables és Adatfolyam-Orkesztráció

  • 1. óra • Adatfolyam Konfiguráció és Telepítés

    Adatfolyam-beállítások, fürt szabályzatok és telepítés oktatása felhasználói felületen és API-n keresztül. A hallgatók éles üzemre kész adatfolyamokat konfigurálnak megfelelő számítási és tárolási beállításokkal.

  • 2. óra • DLT Figyelése és Hibaelhárítása

    Az eseménynapló, az adatfolyam felhasználói felület metrikái és a gyakori hibaminták felfedezése. A hallgatók a beépített megfigyelhetőségi eszközök segítségével diagnosztizálják és oldják meg az adatfolyam-problémákat.

  • 3. óra • Adatminőség Elvárásokkal

    Az EXPECT, EXPECT OR DROP és EXPECT OR FAIL megszorítások ismertetése a DLT-ben. A hallgatók minőségi szabályokat ágyaznak közvetlenül az adatfolyam-definíciókba az automatikus kikényszerítés érdekében.

  • 4. óra • Adatfolyamok Orkesztrációja Databricks Workflows segítségével

    DLT adatfolyamok integrálása többfeladatos Databricks Workflows munkafolyamatokba függőségekkel és ütemezéssel. A hallgatók végpontok közötti orkesztrált adattermékeket építenek.

  • 5. óra • Delta Live Tables Alapfogalmak

    A DLT szintaxis, az élő táblák, a streamelt élő táblák és az adatfolyam-gráf bemutatása. Kialakítja azt a deklaratív paradigmát, amely megkülönbözteti a DLT-t az imperatív Spark kódtól.

6. fejezetRészletek megtekintése

Unity Catalog és adatirányítás

  • 1. óra • Identitás- és Hozzáférés-kezelés

    Felhasználók, csoportok, szolgáltatásnevek és jogosultságok oktatása a Unity Catalogban. A hallgatók a legkisebb jogosultság elvén alapuló hozzáférési modelleket valósítanak meg az adatvagyonhoz.

  • 2. óra • Unity Catalog Architektúra

    A metastore, katalógus, séma és táblahierarchia magyarázata a Unity Catalogban. Strukturális megértést biztosít a szabályozott névterek tervezéséhez.

  • 3. óra • Adatok Megosztása Delta Sharing segítségével

    A nyílt Delta Sharing protokoll bemutatása platformokon és szervezeteken átívelő adatmegosztáshoz. A hallgatók biztonságosan tesznek közzé és fogyasztanak megosztott adatkészleteket.

  • 4. óra • Naplózás és Megfelelőség

    Naplóhozzáférés, lekérdezési előzmények és megfelelőségi jelentési minták oktatása. A hallgatók olyan figyelést konfigurálnak, amely kielégíti a vállalati naplózási követelményeket.

  • 5. óra • Adatszármaztatás és Felfedezés

    Az automatikus származtatás-rögzítés és az adatböngésző bemutatása az adatvagyon felfedezéséhez. A hallgatók a származtatást használják az adatfolyam nyomon követésére és a hatáselemzés támogatására.

7. fejezetRészletek megtekintése

Haladó Spark Optimalizálás és Hangolás

  • 1. óra • Költségalapú Optimalizálás és Statisztikák

    Az ANALYZE TABLE, oszlopstatisztikák és a költségalapú optimalizáló join-átrendezésének ismertetése. A hallgatók statisztikákat gyűjtenek és hasznosítanak a tervminőség javítása érdekében.

  • 2. óra • Memóriakezelés és Kiömlés

    A Spark memóriaterületei, a végrehajtó méretezése, valamint a kiömlés észlelése és mérséklése. A hallgatók olyan memóriabeállításokat konfigurálnak, amelyek kiküszöbölik a költséges lemezkiömlést.

  • 3. óra • Photon Motor és Vektorizált Végrehajtás

    A Databricks Photon motorjának és vektorizált végrehajtási előnyeinek bemutatása. A hallgatók azonosítják azokat a munkaterheléseket, amelyek a legtöbbet profitálnak a Photonból, és megfelelően engedélyezik azt.

  • 4. óra • Particionálási és Shuffle Stratégiák

    Optimális partíciószám, újraparticionálás vs. coalesce és shuffle hangolás oktatása. A hallgatók kiküszöbölik az adatferdeséget és csökkentik a shuffle többletterhelését összetett adatfolyamokban.

  • 5. óra • Adaptív Lekérdezés-végrehajtás

    Az AQE futásidejű tervkiigazításainak magyarázata join-okhoz, ferdeséghez és egyesítéshez. A hallgatók engedélyezik és konfigurálják az AQE-t a kézi hangolási többletterhelés csökkentése érdekében.

8. fejezetRészletek megtekintése

Termelési Adatmérnöki Gyakorlatok

  • 1. óra • Költségkezelés és FinOps

    DBU-fogyasztás elemzés, fürt méretezés és spot példány stratégiák ismertetése. A hallgatók csökkentik a számítási költségeket anélkül, hogy feláldoznák az adatfolyam megbízhatóságát.

  • 2. óra • CI/CD Databricks projektekhez

    Databricks Asset Bundles, telepítési automatizálás és környezetléptetés oktatása. A hallgatók egy teljes CI/CD adatfolyamot valósítanak meg a fejlesztéstől az éles üzemig.

  • 3. óra • Biztonság Erősítése és Legjobb Gyakorlatok

    Hálózati elkülönítés, titokkezelés és biztonságos hitelesítő adatok kezelésének oktatása. A hallgatók rétegzett védelmi elveket alkalmaznak az adatvagyon védelme érdekében a termelésben.

  • 4. óra • Adatfolyamok Tesztelése

    Egységtesztelés a pytest-tel, integrációs tesztelési stratégiák és tesztadat-kezelés ismertetése. A hallgatók olyan tesztcsomagot építenek, amely érvényesíti az adatfolyam logikáját a telepítés előtt.

  • 5. óra • Megfigyelhetőség és Adatfolyam Figyelés

    Naplózási keretrendszerek, metrika-kibocsátás és riasztás bemutatása adatfolyamokhoz. A hallgatók olyan adatfolyamokat műszereznek, amelyek proaktívan észlelik a meghibásodásokat és az SLA-megsértéseket.

Tanúsítvány

Érvényes befejezési tanúsítványod

Ez a kurzus neked szól:

  • Adatelemzők: készen állnak arra, hogy az adatok lekérdezésétől a megbízható adatfolyamatok tervezése felé mozduljanak el.

  • Háttérrendszer-fejlesztők: szeretnék programozási készségeiket az adatplatformok területére átirányítani.

  • Junior adatmérnökök: strukturált utat keresnek a termelési szintű Databricks-szakértelem megszerzéséhez.

  • BI-fejlesztők: frissíteni kívánják ETL-munkájukat tóházi natív eszközök használatával.

  • DevOps-mérnökök: kibővítik tevékenységi körüket az adatinfrastruktúra és az adatfolyamat-automatizálás területeivel.

  • Végzős hallgatók: munkahelyi feladatokra kész adatmérnöki készségeket építenek, mielőtt belépnének a munkaerőpiacra.

Mit mondanak a diákjaink

Az órái tökéletesek. Megvettem az egyéves csomagot, és végre lehetőségem van különböző érdekes témákat követni anélkül, hogy platformot kellene váltanom... köszönöm mindazt, amit csinálnak, már ajánlottam is másoknak...
Giulio Carlo
Giulio CarloDigitális Marketing Hallgató
Szeretem, hogy a leckék egyenesen a lényegre térnek, és hogy tudok fejezeteket váltani és átugrani olyan tartalmakat, amikre nincs szükségem.
Mariana Ferres
Mariana FerresFotográfia Hallgató
Szeretem a tartalmat és a videók bemutatási és átírási módját, ami felgyorsítja a folyamatot!
Luciana Alvarenga
Luciana AlvarengaKörömdesign Hallgató
A platform gyors, egyszerű használni. A tartalom sokfélesége és a kiegészítő videók nagyon sokat segítenek a tanulásban.
André Felipe
André FelipePrompt Engineering Hallgató

Főbb képzések

GYIK

Mi a Dedika?

Érvényes a tanúsítvány Magyarországon?

Ingyenesek a tanfolyamok?

Mennyi a tanfolyamok óraszáma?

Milyenek a tanfolyamok?

Hogyan működnek a tanfolyamok?

Mennyi ideig tartanak a tanfolyamok?

Mennyibe kerülnek a tanfolyamok?

Mi az az EAD vagy online tanfolyam, és hogyan működik?

PDF tanfolyam