
Databricks Data Engineering kurzus
Sajátítsa el a teljes Databricks adattechnológiai stack-et – az Apache Spark alapjaitól és a Delta Lake architektúrától a gyártási szintű folyamatorchesztrációig és a vállalati irányításig. Ez a kurzus gyakorlati készségekkel ruházza fel, hogy megbízható, skálázható adatplatformokat tervezhessen, optimalizálhasson és üzemeltethessen. Akár most kezd az adattechnológiában, akár a tóházi szakértelmét szeretné továbbfejleszteni, ez a meghatározó Databricks-képzés.
Mit fogsz megtanulni:
Konfigurálja és kezelje hatékonyan a Databricks-fürtöket, munkaterületeket és számítási erőforrásokat.
Építsen skálázható ELT-folyamatokat az Auto Loader, a Structured Streaming és a medallion architektúra segítségével.
Valósítson meg Delta Lake-táblákat ACID-tranzakciókkal, időutazással és sémafejlesztéssel.
Hozzon létre deklaratív, öngyógyító folyamatokat Delta Live Tables segítségével, minőségi elvárásokkal.
Alkalmazzon fejlett Spark-hangolási technikákat, beleértve az AQE-t, a particionálási stratégiákat és a Photon motort.
Az enterprise szintű adatirányítás, hozzáférés-szabályozás és az adatok származásának nyomon követésének biztosítása a Unity Catalog használatával.
Hogyan tanulhatsz gyakorlatiasan Databricks Data Engineering kurzus
Hogyan gyakorolsz Databricks Data Engineering kurzus
Önnek, ha vállalatként szeretné képezni a csapatát
A Dedika vállalatoknak szóló képzésein a tanfolyam saját üzleti példákkal és gyakorlatokkal, az Ön cégének igényeihez igazítva érhető el.
A kurzus tartalma
8 Fejezet • 40 Óra4 és 360 óra közötti időtartam (te döntesz)
1. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseDatabricks Platform Alapjai
Databricks Platform Alapjai
1. óra • Fürtkonfiguráció és -kezelés
A fürtlétrehozás, -méretének meghatározása, automatikus skálázása és leállítási szabályzatainak oktatása. A hallgatók kezdetektől fogva kézben tartják a számítási költségeket és a teljesítményt.
2. óra • Databricks Architektúra Áttekintése
A Databrickset alátámasztó vezérlősík, adatsík és fürtarchitektúra ismertetése. Minden további platformhasználatot egy tiszta mentális modellbe ágyaz.
3. óra • Munkaterület-navigáció és -beállítás
A Databricks felhasználói felületének, mappaszerkezetének és felhasználói beállításainak bemutatása. Lehetővé teszi a hallgatók számára projektek szervezését és személyes környezeteik hatékony kezelését.
4. óra • Databricks CLI és REST API Alapok
A platform programozott elérésének bemutatása CLI-n és REST API-n keresztül. Felkészíti a hallgatókat a későbbi fejezetekben tárgyalt automatizálási feladatokra.
5. óra • Jegyzetfüzetek és Együttműködésen Alapuló Fejlesztés
A jegyzetfüzet-létrehozás, varázsparancsok és valós idejű együttműködési funkciók felfedezése. Kialakítja a kurzus során használt elsődleges fejlesztési felületet.
2. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseApache Spark Alapfogalmak
Apache Spark Alapfogalmak
1. óra • Transzformációk és Akciók
A keskeny és széles transzformációk megkülönböztetése és az akció kiváltó okainak magyarázata. A hallgatók megtanulják értelmezni a shuffle-költségeket és a végrehajtási határokat.
2. óra • Spark Elosztott Végrehajtási Modell
Az RDD-k, DAG-ok, szakaszok és feladatok magyarázata a Spark végrehajtási motorjában. A koncepcionális alapot nyújtja hatékony elosztott kód írásához.
3. óra • DataFrame API Alapok
A DataFrame-létrehozás, sémainferencia és alapvető transzformációk ismertetése. A hallgatók ezeket a műveleteket alkalmazzák elsődleges adatmanipulációs felületként.
4. óra • Spark Teljesítmény Alapok
A Spark felhasználói felületének, végrehajtási terveinek és alapvető hangolási lehetőségeinek bemutatása. Felkészíti a hallgatókat a gyakori teljesítmény-szűk keresztmetszetek diagnosztizálására és kezelésére.
5. óra • Spark SQL és Katalógus
SQL lekérdezések oktatása DataFrame-eken és a Spark katalógus használata metaadat-kezeléshez. Áthidalja az SQL ismereteket a programozott Spark használattal.
3. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseDelta Lake Architektúra és Műveletek
Delta Lake Architektúra és Műveletek
1. óra • Delta Lake Tárolási Formátum
A Delta Lake-et alkotó Parquet fájlok, tranzakciós napló és ellenőrzőpont-fájlok magyarázata. A hallgatók megértik, miért nyújt a Delta megbízhatóságot a nyers fájlformátumokkal szemben.
2. óra • Delta Táblák Létrehozása és Kezelése
DDL a Delta táblák létrehozásához, módosításához és törléséhez. Kialakítja az összes további adatfolyam-munkához szükséges táblakezelési készségeket.
3. óra • ACID Tranzakciók és Konkurencia
Optimista konkurencia-vezérlés, izolációs szintek és konfliktuskezelés oktatása a Deltában. A hallgatók olyan adatfolyamokat tervezhetnek, amelyek biztonságosan kezelik az egyidejű írási műveleteket.
4. óra • Delta Lake Optimalizálási Technikák
Az OPTIMIZE, Z-rendezés és fájltömörítés ismertetése a lekérdezési teljesítmény javítása érdekében. A hallgatók ezeket a technikákat alkalmazzák éles szintű Delta táblákra.
5. óra • Időutazás és Adatverziózás
Korábbi táblaverziók lekérdezésének és korábbi állapotok visszaállításának bemutatása. Lehetővé teszi a naplózási, visszaállítási és reprodukálhatósági mintákat az adatfolyamokban.
4. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseAdatbetöltés és ELT Minták
Adatbetöltés és ELT Minták
1. óra • ELT Tervezési Minták
A medallion architektúra és a növekményes betöltési stratégiák bemutatása strukturált ELT-hez. A hallgatók többlépcsős adatfolyamokat terveznek, amelyek elkülönítik a nyers, tisztított és összeállított rétegeket.
2. óra • Kötegelt Betöltés Gyakori Forrásokból
Olvasás oktatása felhőalapú objektumtárolóból, JDBC adatbázisokból és fájlformátumokból. Biztosítja a betöltési alapot a fejezet összes adatfolyam-mintájához.
3. óra • Adatminőség Kikényszerítése Betöltéskor
Megszorítás-alapú érvényesítés, karantén minták és elvárás keretrendszerek oktatása. Biztosítja, hogy az adatminőséget még azelőtt kikényszerítsék, mielőtt az adatok elérnék a downstream fogyasztókat.
4. óra • Strukturált Streamelés Alapok
A streamelt DataFrame-ek, triggerek és kimeneti módok ismertetése folyamatos adatfeldolgozáshoz. Összeköti a streamelt fogalmakat a termelésben használt Delta Lake desztinációval.
5. óra • Automatikus Betöltő Növekményes Betöltéshez
Az Automatikus Betöltő fájlértesítési és könyvtárlistázási módjának bemutatása skálázható növekményes betöltésekhez. A hallgatók konfigurálják az Automatikus Betöltő ellenőrzőpontját és sémafejlődését.
5. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseDelta Live Tables és Adatfolyam-Orkesztráció
Delta Live Tables és Adatfolyam-Orkesztráció
1. óra • Adatfolyam Konfiguráció és Telepítés
Adatfolyam-beállítások, fürt szabályzatok és telepítés oktatása felhasználói felületen és API-n keresztül. A hallgatók éles üzemre kész adatfolyamokat konfigurálnak megfelelő számítási és tárolási beállításokkal.
2. óra • DLT Figyelése és Hibaelhárítása
Az eseménynapló, az adatfolyam felhasználói felület metrikái és a gyakori hibaminták felfedezése. A hallgatók a beépített megfigyelhetőségi eszközök segítségével diagnosztizálják és oldják meg az adatfolyam-problémákat.
3. óra • Adatminőség Elvárásokkal
Az EXPECT, EXPECT OR DROP és EXPECT OR FAIL megszorítások ismertetése a DLT-ben. A hallgatók minőségi szabályokat ágyaznak közvetlenül az adatfolyam-definíciókba az automatikus kikényszerítés érdekében.
4. óra • Adatfolyamok Orkesztrációja Databricks Workflows segítségével
DLT adatfolyamok integrálása többfeladatos Databricks Workflows munkafolyamatokba függőségekkel és ütemezéssel. A hallgatók végpontok közötti orkesztrált adattermékeket építenek.
5. óra • Delta Live Tables Alapfogalmak
A DLT szintaxis, az élő táblák, a streamelt élő táblák és az adatfolyam-gráf bemutatása. Kialakítja azt a deklaratív paradigmát, amely megkülönbözteti a DLT-t az imperatív Spark kódtól.
6. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseUnity Catalog és adatirányítás
Unity Catalog és adatirányítás
1. óra • Identitás- és Hozzáférés-kezelés
Felhasználók, csoportok, szolgáltatásnevek és jogosultságok oktatása a Unity Catalogban. A hallgatók a legkisebb jogosultság elvén alapuló hozzáférési modelleket valósítanak meg az adatvagyonhoz.
2. óra • Unity Catalog Architektúra
A metastore, katalógus, séma és táblahierarchia magyarázata a Unity Catalogban. Strukturális megértést biztosít a szabályozott névterek tervezéséhez.
3. óra • Adatok Megosztása Delta Sharing segítségével
A nyílt Delta Sharing protokoll bemutatása platformokon és szervezeteken átívelő adatmegosztáshoz. A hallgatók biztonságosan tesznek közzé és fogyasztanak megosztott adatkészleteket.
4. óra • Naplózás és Megfelelőség
Naplóhozzáférés, lekérdezési előzmények és megfelelőségi jelentési minták oktatása. A hallgatók olyan figyelést konfigurálnak, amely kielégíti a vállalati naplózási követelményeket.
5. óra • Adatszármaztatás és Felfedezés
Az automatikus származtatás-rögzítés és az adatböngésző bemutatása az adatvagyon felfedezéséhez. A hallgatók a származtatást használják az adatfolyam nyomon követésére és a hatáselemzés támogatására.
7. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseHaladó Spark Optimalizálás és Hangolás
Haladó Spark Optimalizálás és Hangolás
1. óra • Költségalapú Optimalizálás és Statisztikák
Az ANALYZE TABLE, oszlopstatisztikák és a költségalapú optimalizáló join-átrendezésének ismertetése. A hallgatók statisztikákat gyűjtenek és hasznosítanak a tervminőség javítása érdekében.
2. óra • Memóriakezelés és Kiömlés
A Spark memóriaterületei, a végrehajtó méretezése, valamint a kiömlés észlelése és mérséklése. A hallgatók olyan memóriabeállításokat konfigurálnak, amelyek kiküszöbölik a költséges lemezkiömlést.
3. óra • Photon Motor és Vektorizált Végrehajtás
A Databricks Photon motorjának és vektorizált végrehajtási előnyeinek bemutatása. A hallgatók azonosítják azokat a munkaterheléseket, amelyek a legtöbbet profitálnak a Photonból, és megfelelően engedélyezik azt.
4. óra • Particionálási és Shuffle Stratégiák
Optimális partíciószám, újraparticionálás vs. coalesce és shuffle hangolás oktatása. A hallgatók kiküszöbölik az adatferdeséget és csökkentik a shuffle többletterhelését összetett adatfolyamokban.
5. óra • Adaptív Lekérdezés-végrehajtás
Az AQE futásidejű tervkiigazításainak magyarázata join-okhoz, ferdeséghez és egyesítéshez. A hallgatók engedélyezik és konfigurálják az AQE-t a kézi hangolási többletterhelés csökkentése érdekében.
8. fejezetElrejtésRészletek elrejtéseRészletek megtekintéseTermelési Adatmérnöki Gyakorlatok
Termelési Adatmérnöki Gyakorlatok
1. óra • Költségkezelés és FinOps
DBU-fogyasztás elemzés, fürt méretezés és spot példány stratégiák ismertetése. A hallgatók csökkentik a számítási költségeket anélkül, hogy feláldoznák az adatfolyam megbízhatóságát.
2. óra • CI/CD Databricks projektekhez
Databricks Asset Bundles, telepítési automatizálás és környezetléptetés oktatása. A hallgatók egy teljes CI/CD adatfolyamot valósítanak meg a fejlesztéstől az éles üzemig.
3. óra • Biztonság Erősítése és Legjobb Gyakorlatok
Hálózati elkülönítés, titokkezelés és biztonságos hitelesítő adatok kezelésének oktatása. A hallgatók rétegzett védelmi elveket alkalmaznak az adatvagyon védelme érdekében a termelésben.
4. óra • Adatfolyamok Tesztelése
Egységtesztelés a pytest-tel, integrációs tesztelési stratégiák és tesztadat-kezelés ismertetése. A hallgatók olyan tesztcsomagot építenek, amely érvényesíti az adatfolyam logikáját a telepítés előtt.
5. óra • Megfigyelhetőség és Adatfolyam Figyelés
Naplózási keretrendszerek, metrika-kibocsátás és riasztás bemutatása adatfolyamokhoz. A hallgatók olyan adatfolyamokat műszereznek, amelyek proaktívan észlelik a meghibásodásokat és az SLA-megsértéseket.
Érvényes befejezési tanúsítványod
Ez a kurzus neked szól:
Adatelemzők: készen állnak arra, hogy az adatok lekérdezésétől a megbízható adatfolyamatok tervezése felé mozduljanak el.
Háttérrendszer-fejlesztők: szeretnék programozási készségeiket az adatplatformok területére átirányítani.
Junior adatmérnökök: strukturált utat keresnek a termelési szintű Databricks-szakértelem megszerzéséhez.
BI-fejlesztők: frissíteni kívánják ETL-munkájukat tóházi natív eszközök használatával.
DevOps-mérnökök: kibővítik tevékenységi körüket az adatinfrastruktúra és az adatfolyamat-automatizálás területeivel.
Végzős hallgatók: munkahelyi feladatokra kész adatmérnöki készségeket építenek, mielőtt belépnének a munkaerőpiacra.
Mit mondanak a diákjaink
Az órái tökéletesek. Megvettem az egyéves csomagot, és végre lehetőségem van különböző érdekes témákat követni anélkül, hogy platformot kellene váltanom... köszönöm mindazt, amit csinálnak, már ajánlottam is másoknak...

Szeretem, hogy a leckék egyenesen a lényegre térnek, és hogy tudok fejezeteket váltani és átugrani olyan tartalmakat, amikre nincs szükségem.

Szeretem a tartalmat és a videók bemutatási és átírási módját, ami felgyorsítja a folyamatot!

A platform gyors, egyszerű használni. A tartalom sokfélesége és a kiegészítő videók nagyon sokat segítenek a tanulásban.

Főbb képzések
GYIK
Mi a Dedika?
Érvényes a tanúsítvány Magyarországon?
Ingyenesek a tanfolyamok?
Mennyi a tanfolyamok óraszáma?
Milyenek a tanfolyamok?
Hogyan működnek a tanfolyamok?
Mennyi ideig tartanak a tanfolyamok?
Mennyibe kerülnek a tanfolyamok?
Mi az az EAD vagy online tanfolyam, és hogyan működik?
PDF tanfolyam




















