
Kurz Data Engineering s Databricks
Zvládněte celý stack datového inženýrství Databricks — od základů Apache Sparku a architektury Delta Lake až po orchestraci produkčních pipeline a podnikovou správu. Tento kurz vás vybaví praktickými dovednostmi pro návrh, optimalizaci a provoz spolehlivých datových platforem, které se škálují. Ať už vstupujete do datového inženýrství nebo si zvyšujete odbornost v oblasti lakehousů, toto je definitivní školení Databricks.
Co se naučíte:
Efektivně konfigurujte a spravujte clustery, pracovní prostory a výpočetní zdroje Databricks.
Vytvářejte škálovatelné ELT pipeline s využitím Auto Loaderu, Structured Streamingu a architektury medailonů.
Implementujte tabulky Delta Lake s ACID transakcemi, cestováním v čase a vývojem schématu.
Vytvářejte deklarativní, samo-opravné pipeline s Delta Live Tables a očekáváními kvality.
Aplikujte pokročilé techniky ladění Sparku včetně AQE, strategií rozdělování a enginu Photon.
Prosazujte podnikovou správu dat, řízení přístupu a sledování původu pomocí Unity Catalogu.
Jak studujete v praxi Kurz Data Engineering s Databricks
Jak procvičujete Kurz Data Engineering s Databricks
Pro vás, kteří jste firma a chcete školit svůj tým
V Dedika pro firmy je kurz doplněn o cvičení a příklady přímo z vašeho podnikání a přizpůsoben tak, jak vaše firma potřebuje.
Obsah kurzu
8 Kapitoly • 40 LekceDélka mezi 4 a 360 hodinami (rozhodujete vy)
Kapitola 1SkrýtSkrýt detailyZobrazit detailyZáklady platformy Databricks
Základy platformy Databricks
Lekce 1 • Konfigurace a správa clusterů (výpočetních / databázových)
Učí vytváření clusterů, dimenzování, automatické škálování a politiky ukončování. Studenti získávají kontrolu nad výpočetními náklady a výkonem hned od začátku.
Lekce 2 • Přehled architektury Databricks
Pokrývá řídicí rovinu, datovou rovinu a architekturu clusteru, na kterých je Databricks postaven. Zakotvuje veškeré následné používání platformy v jasném mentálním modelu.
Lekce 3 • Navigace v pracovním prostředí a jeho nastavení
Představuje uživatelské rozhraní Databricks, strukturu složek a uživatelská nastavení. Umožňuje studentům efektivně organizovat projekty a spravovat osobní prostředí.
Lekce 4 • Základy rozhraní Databricks CLI a REST API
Představuje programový přístup k platformě prostřednictvím CLI a REST API. Připravuje studenty na úlohy automatizace, které jsou probírány v pozdějších kapitolách.
Lekce 5 • Notebooky a kolaborativní vývoj
Zkoumá tvorbu notebooků, magické příkazy a funkce pro spolupráci v reálném čase. Stanovuje primární vývojové rozhraní používané v celém kurzu.
Kapitola 2SkrýtSkrýt detailyZobrazit detailyZákladní pojmy Apache Spark
Základní pojmy Apache Spark
Lekce 1 • Transformace a akce
Rozlišuje úzké a široké transformace a vysvětluje spouštěče akcí. Studenti se naučí uvažovat o nákladech na míchání a hranicích provádění.
Lekce 2 • Distribuovaný prováděcí model Sparku
Vysvětluje RDD, DAG, fáze a úlohy v rámci vykonávacího jádra Sparku. Poskytuje koncepční základy pro psaní efektivního distribuovaného kódu.
Lekce 3 • Základy DataFrame API
Pokrývá vytváření DataFrame, odvozování schémat a základní transformace. Studenti tyto operace používají jako primární rozhraní pro manipulaci s daty.
Lekce 4 • Základy výkonu Sparku
Představuje uživatelské rozhraní Spark, plány provádění a základní možnosti ladění. Vybavuje studenty dovednostmi pro diagnostiku a řešení běžných úzkých míst výkonu.
Lekce 5 • Spark SQL a katalog
Učí SQL dotazy nad datovými rámci (DataFrames) a práci s katalogem Sparku pro správu metadat. Propojuje znalosti SQL s programovým využitím Sparku.
Kapitola 3SkrýtSkrýt detailyZobrazit detailyArchitektura a provoz Delta Lake
Architektura a provoz Delta Lake
Lekce 1 • Úložný formát Delta Lake
Vysvětluje soubory Parquet, transakční protokol a kontrolní soubory, které tvoří Delta Lake. Studenti pochopí, proč Delta poskytuje spolehlivost oproti syrovým souborovým formátům.
Lekce 2 • Vytváření a správa delta tabulek
Zahrnuje DDL pro vytváření, úpravu a odstraňování Delta tabulek. Stanovuje dovednosti správy tabulek potřebné pro veškerou budoucí práci s datovými pipeline.
Lekce 3 • ACID transakce a souběžnost
Vysvětluje optimistické řízení souběžnosti, úrovně izolace a řešení konfliktů v nástroji Delta. Studenti mohou navrhovat pipeline, které bezpečně zvládají souběžné zápisy.
Lekce 4 • Techniky optimalizace Delta Lake
Zahrnuje OPTIMIZE, Z-řazení a kompresi souborů pro zlepšení výkonu dotazů. Studenti tyto techniky použijí na produkčních Delta tabulkách.
Lekce 5 • Cestování v čase a verzování dat
Ukazuje dotazování historických verzí tabulek a obnovu předchozích stavů. Umožňuje audit, vrácení změn a reprodukovatelnost v datových pipelinech.
Kapitola 4SkrýtSkrýt detailyZobrazit detailyPříjem dat a vzory ELT
Příjem dat a vzory ELT
Lekce 1 • Návrhové vzory ELT
Představuje medailonovou architekturu a strategie přírůstkového načítání pro strukturovaný ELT. Studenti navrhují vícestupňové pipeline, které oddělují vrstvy surových, vyčištěných a zpracovaných dat.
Lekce 2 • Dávkové příjímání dat z běžných zdrojů
Ukazuje čtení z cloudového objektového úložiště, JDBC databází a souborových formátů. Poskytuje základ pro ingestování dat pro všechny pipeline vzory v této kapitole.
Lekce 3 • Vynucování kvality dat při ingestu
Učí validaci založenou na omezeních, vzory karantény a rámce očekávání. Zajišťuje vynucení kvality dat ještě předtím, než se data dostanou ke spotřebitelům v navazujících systémech.
Lekce 4 • Základy strukturovaného streamování
Pokrývá streamovací DataFrames, triggery a výstupní režimy pro kontinuální zpracování dat. Propojuje streamovací pojmy s jímkou Delta Lake používanou v produkci.
Lekce 5 • Automatické načítání pro přírůstkové zpracování dat
Představuje režimy oznamování souborů a výpisu adresářů nástroje Auto Loader pro škálovatelné přírůstkové načítání. Studenti konfigurují ukládání kontrolních bodů a vývoj schématu v nástroji Auto Loader.
Kapitola 5SkrýtSkrýt detailyZobrazit detailyDelta Live Tables a orchestrace pipeline
Delta Live Tables a orchestrace pipeline
Lekce 1 • Konfigurace a nasazení pipeline
Seznámí vás s nastavením pipeline, politikami clusteru a nasazením prostřednictvím UI a API. Studenti nakonfigurují produkčně připravené pipeline s vhodným nastavením výpočetních a úložných prostředků.
Lekce 2 • Monitorování a řešení problémů DLT
Prozkoumává protokol událostí, metriky uživatelského rozhraní pipeline a běžné vzorce selhání. Studenti diagnostikují a řeší problémy pipeline pomocí vestavěných nástrojů pro pozorovatelnost.
Lekce 3 • Kvalita dat pomocí nástroje Expectations
Pokrývá omezení EXPECT, EXPECT OR DROP a EXPECT OR FAIL v DLT. Studenti vkládají pravidla kvality přímo do definic pipeline pro automatizované vynucování.
Lekce 4 • Orchestrace pipelineů pomocí Databricks Workflows
Začleňuje DLT pipeline do víceúlohových Databricks Workflows se závislostmi a plánováním. Studenti sestavují komplexní orchestraci datových produktů od začátku do konce.
Lekce 5 • Základní pojmy Delta Live Tables
Představuje syntaxi DLT, živé tabulky, streamovací živé tabulky a graf pipeline. Stanovuje deklarativní paradigma, které odlišuje DLT od imperativního kódu Sparku.
Kapitola 6SkrýtSkrýt detailyZobrazit detailyUnity Catalog a správa dat
Unity Catalog a správa dat
Lekce 1 • Správa identit a přístupů
Pokrývá uživatele, skupiny, instanční objekty a přidělování oprávnění v Unity Catalogu. Studenti zavádějí modely přístupu s nejnižšími oprávněními pro datové prostředky.
Lekce 2 • Architektura Unity Catalogu
Vysvětluje hierarchii metastoru, katalogu, schématu a tabulky v rámci Unity Catalog. Poskytuje strukturální porozumění potřebné pro návrh řízených jmenných prostorů.
Lekce 3 • Sdílení dat pomocí Delta Sharing
Představuje otevřený protokol Delta Sharing pro sdílení dat napříč platformami a organizacemi. Studenti bezpečně publikují a využívají sdílené datové sady.
Lekce 4 • Audit a dodržování předpisů
Pokrývá přístup k auditním logům, historii dotazů a vzory hlášení o souladu s předpisy. Studenti konfigurují monitorování tak, aby vyhovělo požadavkům podnikových auditů.
Lekce 5 • Rodokmen a zjišťování dat
Ukazuje automatické zachycování původu dat a průzkumník dat pro objevování aktiv. Studenti používají původ dat ke sledování toku dat a pro podporu analýzy dopadů.
Kapitola 7SkrýtSkrýt detailyZobrazit detailyPokročilá optimalizace a ladění Sparku
Pokročilá optimalizace a ladění Sparku
Lekce 1 • Optimalizace založená na nákladech a statistiky
Pokrývá ANALYZE TABLE, statistiky sloupců a změnu pořadí spojení nákladově orientovaným optimalizátorem. Studenti sbírají a využívají statistiky ke zlepšení kvality plánů.
Lekce 2 • Správa paměti a spill
Pokrývá paměťové oblasti Sparku, dimenzování exekutorů a detekci a zmírnění spillování. Studenti konfigurují nastavení paměti tak, aby eliminovali nákladné spillování na disk.
Lekce 3 • Photon Engine a vektorizované provádění
Představuje engine Databricks Photon a výhody jeho vektorizovaného provádění. Studenti identifikují úlohy, které z Photonu nejvíce těží, a vhodně jej aktivují.
Lekce 4 • Strategie rozdělování a přeskupování
Učí optimální počty oddílů, repartition vs. coalesce a ladění shuffle. Studenti odstraňují datovou nerovnováhu a snižují režii shuffle ve složitých pipelinech.
Lekce 5 • Adaptivní provádění dotazů
Vysvětluje úpravy běhového plánu AQE pro spojování, nerovnoměrné rozdělení dat a slučování. Studenti povolí a nakonfigurují AQE, aby snížili režii ručního ladění.
Kapitola 8SkrýtSkrýt detailyZobrazit detailyPraxe v oblasti datového inženýrství ve výrobě
Praxe v oblasti datového inženýrství ve výrobě
Lekce 1 • Správa nákladů a FinOps
Pokrývá analýzu spotřeby DBU, správné dimenzování clusterů a strategie využití spot instancí. Studenti snižují náklady na výpočetní výkon bez obětování spolehlivosti pipeline.
Lekce 2 • CI/CD pro projekty Databricks
Učí práci s Databricks Asset Bundles, automatizaci nasazení a postupné propagaci mezi prostředími. Studenti zavedou kompletní CI/CD pipeline od vývoje po produkci.
Lekce 3 • Bezpečnostní hardening a osvědčené postupy
Učí síťovou izolaci, správu tajemství a bezpečné nakládání s přihlašovacími údaji. Studenti používají principy hloubkové obrany k ochraně datových aktiv v produkčním prostředí.
Lekce 4 • Testování datových pipelineí
Pokrývá jednotkové testování pomocí pytestu, strategie integračního testování a správu testovacích dat. Studenti sestaví testovací sadu, která před nasazením ověřuje logiku pipeline.
Lekce 5 • Pozorovatelnost a monitorování pipeline
Představuje logovací frameworky, vysílání metrik a upozorňování pro datové pipeline. Studenti vybaví pipeline instrumentací, aby proaktivně odhalovali selhání a porušení dohod SLA.
Váš platný certifikát o dokončení
Tento kurz je pro vás:
Datoví analytici: připraveni přejít od dotazování se na data k inženýringu spolehlivých pipeline.
Backendoví vývojáři: kteří chtějí nasměrovat své programátorské dovednosti do oblasti datových platforem.
Junioři datoví inženýři: hledající strukturovanou cestu k odbornosti v Databricks na produkční úrovni.
BI vývojáři: kteří chtějí modernizovat svou ETL práci pomocí nástrojů nativních pro lakehouse.
DevOps inženýři: rozšiřující svůj záběr o datovou infrastrukturu a automatizaci pipeline.
Absolventi vysokých škol: budující si dovednosti v datovém inženýrství připravené pro praxi před vstupem na trh práce.
Co říkají naši studenti
Vaše lekce jsou perfektní. Koupil jsem si roční balíček a konečně mám možnost sledovat různá témata, která mě zajímají, aniž bych musel měnit platformu... děkuji za vše, co děláte, už jsem vás doporučil dalším lidem...

Líbí se mi, jak jsou lekce přímočaré a jak mohu přepínat mezi kapitolami a přeskakovat obsah, který nepotřebuji.

Líbí se mi obsah a způsob prezentace a přepisu videí, což celý proces zrychluje!

Platforma je rychlá a jednoduchá na používání. Rozmanitost obsahu a doplňková videa velmi pomáhají při učení.

Hlavní školení
Často kladené otázky
Kdo je Dedika?
Je certifikát platný v Česko?
Jsou kurzy zdarma?
Jaká je pracovní zátěž kurzu?
Jak kurzy vypadají?
Jak kurzy fungují?
Jaká je délka kurzů?
Jaká je cena nebo poplatek za kurzy?
Co je EAD nebo online kurz a jak funguje?
PDF kurz




















