
Cursus Data Engineering met Databricks
Beheers de volledige Databricks-data-engineeringstack — van Apache Spark-grondbeginselen en Delta Lake-architectuur tot productieklare pijplijnorkestratie en enterprise-governance. Deze cursus geeft je de praktische vaardigheden om betrouwbare dataplatformen te ontwerpen, optimaliseren en beheren die schalen. Of je nu in data-engineering begint of je lakehouse-expertise wilt uitbreiden, dit is de definitieve Databricks-training.
Wat jouw team gaat beheersen:
Configureer en beheer Databricks-clusters, -werkruimten en -computerbronnen efficiënt.
Bouw schaalbare ELT-datapijplijnen met Auto Loader, Structured Streaming en medaillonarchitectuur.
Implementeer Delta Lake-tabellen met ACID-transacties, tijdreizen en schema-evolutie.
Creëer declaratieve, zelfherstellende pijplijnen met Delta Live Tables en kwaliteitsverwachtingen.
Pas geavanceerde Spark-optimalisatietechnieken toe, waaronder AQE, partitioneringsstrategieën en de Photon-engine.
Handhaaf enterprise-data governance, toegangscontrole en herkomstregistratie met Unity Catalog.
Hoe jouw team praktisch leert Cursus Data Engineering met Databricks
Hoe jouw team oefent Cursus Data Engineering met Databricks
Professionals van deze bedrijven leren bij Dedika









Cursusinhoud
8 Hoofdstukken • 40 LessenDuur tussen 4 en 360 uren (jij beslist)
Hoofdstuk 1VerbergenVerberg detailsBekijk detailsDatabricks Platform Fundamentals
Databricks Platform Fundamentals
Les 1 • Clusterconfiguratie en -beheer
Leert clustercreatie, -grootteschaling, -automatisch schalen en beëindigingsbeleid. Studenten krijgen vanaf het begin controle over compute-kosten en prestaties.
Les 2 • Overzicht van de Databricks-architectuur
Behandelt het controleplan, het dataplan en de clusterarchitectuur die ten grondslag liggen aan Databricks. Plaatst alle volgende platformgebruik in een helder mentaal model.
Les 3 • Workspacenavigatie en -installatie
Introduceert de Databricks-UI, mapstructuur en gebruikersinstellingen. Stelt studenten in staat projecten te organiseren en persoonlijke omgevingen effectief te beheren.
Les 4 • Basisprincipes van de Databricks CLI en REST API
Introduceert programmatische toegang tot het platform via CLI en REST API. Bereidt studenten voor op automatiseringstaken die in latere hoofdstukken aan bod komen.
Les 5 • Notebooks en collaboratieve ontwikkeling
Verkent het maken van notitieboeken, magische commando's en functies voor real-time samenwerking. Vestigt de primaire ontwikkelinterface die in de hele cursus wordt gebruikt.
Hoofdstuk 2VerbergenVerberg detailsBekijk detailsApache Spark-kernconcepten
Apache Spark-kernconcepten
Les 1 • Transformaties en acties
Maakt onderscheid tussen smalle en brede transformaties en legt actietriggers uit. Studenten leren nadenken over shuffle-kosten en uitvoeringsgrenzen.
Les 2 • Gedistribueerd uitvoeringsmodel van Spark
Legt RDD's, DAG's, stages en taken uit binnen Spark's uitvoeringsengine. Biedt de conceptuele basis voor het schrijven van efficiënte gedistribueerde code.
Les 3 • Basisbeginselen van de DataFrame-API
Behandelt het maken van DataFrames, schema-inferentie en kerntransformaties. Studenten passen deze bewerkingen toe als de primaire interface voor gegevensmanipulatie.
Les 4 • Basisprincipes van Spark-prestaties
Introduceert de Spark-UI, uitvoeringsplannen en basisafstemmingsmogelijkheden. Rust studenten uit om veelvoorkomende prestatieknelpunten te diagnosticeren en aan te pakken.
Les 5 • Spark SQL en Catalog
Leert SQL-query's op DataFrames en de Spark-catalogus voor metadata-beheer. Overbrugt SQL-kennis met programmatisch Spark-gebruik.
Hoofdstuk 3VerbergenVerberg detailsBekijk detailsDelta Lake-architectuur en -bewerkingen
Delta Lake-architectuur en -bewerkingen
Les 1 • Opslagformaat van Delta Lake
Legt Parquet-bestanden, het transactielogboek en checkpoint-bestanden uit die Delta Lake vormen. Studenten begrijpen waarom Delta betrouwbaarheid biedt ten opzichte van onbewerkte bestandsformaten.
Les 2 • Delta-tabellen maken en beheren
Behandelt DDL voor het maken, wijzigen en verwijderen van Delta-tabellen. Vestigt de tabelbeheervaardigheden die nodig zijn voor al het pijplijnwerk dat voor ons ligt.
Les 3 • ACID-transacties en gelijktijdigheid
Leert optimistische gelijktijdigheidsregeling, isolatieniveaus en conflictoplossing in Delta. Studenten kunnen pijplijnen ontwerpen die veilig gelijktijdige schrijfbewerkingen verwerken.
Les 4 • Optimalisatietechnieken voor Delta Lake
Behandelt OPTIMIZE, Z-ordering en bestandscompacting om de queryprestaties te verbeteren. Studenten passen deze technieken toe op Delta-tabellen van productiekwaliteit.
Les 5 • Tijdreizen en gegevensversiebeheer
Demonstreert het opvragen van historische tabelversies en het herstellen van eerdere toestanden. Maakt audit-, terugdraai- en reproduceerbaarheidspatronen in gegevenspijplijnen mogelijk.
Hoofdstuk 4VerbergenVerberg detailsBekijk detailsGegevensinname en ELT-patronen
Gegevensinname en ELT-patronen
Les 1 • ELT-ontwerppatronen
Presenteert medaillonarchitectuur en incrementele laadstrategieën voor gestructureerde ELT. Studenten ontwerpen multi-hop-pijplijnen die onbewerkte, opgeschoonde en samengestelde lagen scheiden.
Les 2 • Batch-inname uit veelvoorkomende bronnen
Leert lezen uit cloud-objectopslag, JDBC-databases en bestandsindelingen. Biedt de innamebasis voor alle pijplijnpatronen in dit hoofdstuk.
Les 3 • Handhaving van gegevenskwaliteit bij inname
Leert op beperkingen gebaseerde validatie, quarantainepatronen en verwachtingskaders. Zorgt ervoor dat de gegevenskwaliteit wordt gehandhaafd voordat gegevens stroomafwaartse gebruikers bereiken.
Les 4 • Basisprincipes van Structured Streaming
Behandelt streaming DataFrames, triggers en uitvoermodi voor continue gegevensverwerking. Verbindt streamingconcepten met de Delta Lake-sink die in productie wordt gebruikt.
Les 5 • Auto Loader voor incrementele inname
Introduceert de bestandsmeldings- en directorylistingmodi van Auto Loader voor schaalbare incrementele belastingen. Studenten configureren de checkpointing en schema-evolutie van Auto Loader.
Hoofdstuk 5VerbergenVerberg detailsBekijk detailsDelta Live Tables en pijplijnorkestratie
Delta Live Tables en pijplijnorkestratie
Les 1 • Pijplijnconfiguratie en -implementatie
Leert pijplijninstellingen, clusterbeleid en implementatie via UI en API. Studenten configureren productieklaar pijplijnen met de juiste compute- en opslaginstellingen.
Les 2 • Monitoring en probleemoplossing van DLT
Verkent het gebeurtenislogboek, de pijplijn-UI-statistieken en veelvoorkomende foutpatronen. Studenten diagnosticeren en lossen pijplijnproblemen op met behulp van ingebouwde observeerbaarheidstools.
Les 3 • Gegevenskwaliteit met Expectations
Behandelt EXPECT-, EXPECT OR DROP- en EXPECT OR FAIL-beperkingen in DLT. Studenten integreren kwaliteitsregels rechtstreeks in pijplijndefinities voor geautomatiseerde handhaving.
Les 4 • Pijplijnen orkestreren met Databricks Workflows
Integreert DLT-pijplijnen in multi-task Databricks Workflows met afhankelijkheden en planning. Studenten bouwen end-to-end georkestreerde gegevensproducten.
Les 5 • Kernconcepten van Delta Live Tables
Introduceert DLT-syntaxis, live-tabellen, streaming live-tabellen en de pijplijngrafiek. Vestigt het declaratieve paradigma dat DLT onderscheidt van imperatieve Spark-code.
Hoofdstuk 6VerbergenVerberg detailsBekijk detailsUnity Catalog en data governance
Unity Catalog en data governance
Les 1 • Identiteits- en toegangsbeheer
Behandelt gebruikers, groepen, serviceprincipals en privilegetoekenningen in Unity Catalog. Studenten implementeren toegangsmodellen met minimale rechten voor gegevensactiva.
Les 2 • Unity Catalog-architectuur
Legt de metastore-, catalogus-, schema- en tabelhiërarchie in Unity Catalog uit. Biedt het structurele begrip dat nodig is om beheerde naamruimten te ontwerpen.
Les 3 • Gegevens delen met Delta Sharing
Introduceert het open Delta Sharing-protocol voor het delen van gegevens tussen platforms en organisaties. Studenten publiceren en consumeren veilig gedeelde datasets.
Les 4 • Auditing en compliance
Leert toegang tot auditlogboeken, querygeschiedenis en compliance-rapportagepatronen. Studenten configureren monitoring om te voldoen aan de auditeisen van de onderneming.
Les 5 • Gegevensherkomst en -ontdekking
Demonstreert automatische herkomstvastlegging en de data explorer voor het ontdekken van assets. Studenten gebruiken herkomst om de gegevensstroom te traceren en impactanalyses te ondersteunen.
Hoofdstuk 7VerbergenVerberg detailsBekijk detailsGeavanceerde Spark-optimalisatie en -afstemming
Geavanceerde Spark-optimalisatie en -afstemming
Les 1 • Kostengebaseerde optimalisatie en statistieken
Behandelt ANALYZE TABLE, kolomstatistieken en de join-herordening van de kostengebaseerde optimizer. Studenten verzamelen en benutten statistieken om de plankwaliteit te verbeteren.
Les 2 • Geheugenbeheer en spill
Behandelt Spark-geheugenregio's, executor-grootteschaling en spill-detectie en -beperking. Studenten configureren geheugeninstellingen om kostbare schijf-spill te elimineren.
Les 3 • Photon Engine en gevectoriseerde uitvoering
Introduceert de Databricks Photon-engine en de voordelen van gevectoriseerde uitvoering. Studenten identificeren workloads die het meeste baat hebben bij Photon en schakelen dit op de juiste manier in.
Les 4 • Partitionerings- en shufflestrategieën
Leert optimale partitieaantallen, repartitioneren versus coalescen, en shuffle-afstemming. Studenten elimineren gegevensscheefheid en verminderen shuffle-overhead in complexe pijplijnen.
Les 5 • Adaptieve query-uitvoering
Legt de runtime-plan-aanpassingen van AQE uit voor joins, scheefheid en coalescen. Studenten schakelen AQE in en configureren het om handmatige afstemmingsinspanningen te verminderen.
Hoofdstuk 8VerbergenVerberg detailsBekijk detailsProductiepraktijken voor data-engineering
Productiepraktijken voor data-engineering
Les 1 • Kostenbeheer en FinOps
Behandelt DBU-verbruiksanalyse, cluster right-sizing en spot-instantie-strategieën. Studenten verlagen de computekosten zonder de betrouwbaarheid van de pijplijn op te offeren.
Les 2 • CI/CD voor Databricks-projecten
Leert Databricks Asset Bundles, implementatieautomatisering en omgevingsoverdracht. Studenten implementeren een volledige CI/CD-pijplijn van ontwikkeling tot productie.
Les 3 • Beveiliging hardening en best practices
Leert netwerkisolatie, geheimbeheer en veilig omgaan met referenties. Studenten passen defense-in-depth-principes toe om gegevensactiva in productie te beschermen.
Les 4 • Testen van gegevenspijplijnen
Behandelt unit testing met pytest, integratieteststrategieën en testgegevensbeheer. Studenten bouwen een testsuite die de pijplijnlogica valideert vóór implementatie.
Les 5 • Observeerbaarheid en pijplijnmonitoring
Introduceert loggingkaders, metrische emissies en waarschuwingen voor gegevenspijplijnen. Studenten instrumenteren pijplijnen om proactief fouten en SLA-schendingen te detecteren.
Jouw geldig certificaat van voltooiing
Deze cursus is voor jou:
Data-analisten: klaar om te verschuiven van data bevragen naar het bouwen van betrouwbare pipelines.
Backendontwikkelaars: die hun codeervaardigheden willen omzetten naar het datapatformdomein.
Junior data-engineers: op zoek naar een gestructureerde weg naar Databricks-expertise op productieniveau.
BI-ontwikkelaars: die hun ETL-werk willen moderniseren met lakehouse-native tools.
DevOps-ingenieurs: die hun scope uitbreiden naar datainfrastructuur en pipeline-automatisering.
Afstudeerders: die baanklare data-engineeringvaardigheden opbouwen voordat ze de arbeidsmarkt betreden.
Gerelateerde cursussen
FAQ
Wie is Dedika?
Is het certificaat geldig in Nederland?
Zijn de cursussen gratis?
Wat is de studielast van de cursus?
Hoe zien de cursussen eruit?
Hoe werken de cursussen?
Wat is de duur van de cursussen?
Wat zijn de kosten of prijzen van de cursussen?
Wat is een EAD- of online cursus en hoe werkt het?
PDF-cursus



















