
Data Lake Cursus
Beheers elke laag van modern datalake-engineering, van ruwe opname tot beheerde, analyseklare lakehouses. Deze cursus behandelt architectuur, opslag, verwerking, beveiliging en DataOps in één uitgebreid programma. Of je nu je eerste lake bouwt of een enterprise-platform schaalt, je doet de praktijkervaring op om echte bedrijfswaarde te leveren.
Wat je gaat leren:
Je leert hoe je productiedatalakes van productiekwaliteit ontwerpt en beheert, beginnend met kernarchitectuurconcepten en verdergaand met opslagformaten, opnamepipelines, metadatabeheer en governance. Je implementeert open tabelformaten zoals Delta Lake, Apache Iceberg en Apache Hudi om ACID-transacties en time travel naar lake-opslag te brengen. De cursus behandelt ook gedistribueerde verwerking, query-engineconfiguratie, streamingarchitecturen en ML-integratie. Je past DataOps-praktijken toe zoals CI/CD, infrastructuur als code en datacontracten om pipeline-levering te automatiseren. Tot slot leer je kostenbeheer, observeerbaarheid en hoe je de waarde van een datalake aan leidinggevenden communiceert.
Hoe je praktisch studeert Data Lake Cursus
Hoe je oefent Data Lake Cursus
Voor bedrijven die hun team willen trainen
Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.
Cursusinhoud
8 Hoofdstukken • 39 LessenDuur tussen 4 en 360 uren (jij beslist)
Hoofdstuk 1VerbergenVerberg detailsBekijk detailsGrondslagen van data lake-architectuur
Grondslagen van data lake-architectuur
Les 1 • Wat is een Data Lake
Definieert data lakes en contrasteert ze met datawarehouses en datamarts. Biedt de conceptuele basis voor alle daaropvolgende architectuurkeuzes.
Les 2 • Veelvoorkomende Valkuilen en het Data Swamp-probleem
Identificeert governance-fouten die data lakes in onbruikbare data swamps veranderen. Bewustzijn van deze risico's motiveert best practices die later worden geïntroduceerd.
Les 3 • Data Lake-gebruiksscenario's en Bedrijfswaarde
Koppelt praktijkscenario's – analytics, ML, archivering – aan data lake-capaciteiten. Studenten verbinden technische functies met meetbare bedrijfsresultaten.
Les 4 • Kernkenmerken van Data Lakes
Onderzoekt schema-on-read, multi-formaat opname en schaalbaarheid als bepalende kenmerken. Deze eigenschappen verklaren waarom data lakes geschikt zijn voor diverse analytische workloads.
Hoofdstuk 2VerbergenVerberg detailsBekijk detailsData Lake-opslag en Bestandsformaten
Data Lake-opslag en Bestandsformaten
Les 1 • Opslagniveaus en Kostenoptimalisatie
Legt hot-, warm- en cold-opslaglagen en geautomatiseerd tiering-beleid uit. Studenten ontwerpen kosteneffectieve bewaarstrategieën die zijn afgestemd op toegangspatronen.
Les 2 • Compressiestrategieën voor Data Lakes
Behandelt de afwegingen tussen compressieverhouding en snelheid voor Snappy, Gzip, Zstd en LZ4. Juiste compressie verlaagt opslagkosten zonder de queryprestaties te verminderen.
Les 3 • Kolomgebaseerde en Rijgebaseerde Bestandsformaten
Vergelijkt Parquet, ORC, Avro, CSV en JSON voor analytische workloads. Formaatkeuze heeft directe invloed op querysnelheid en opslagefficiëntie.
Les 4 • Objectopslag als Basis
Legt de werking van objectopslag, bucketorganisatie en duurzaamheidsgaranties uit. Objectopslag is de dominante fysieke laag voor moderne data lakes.
Les 5 • Best Practices voor Partities en Bestandsgrootte
Leert partitiesleutelselectie, partitiepruning en optimale bestandsgroottes. Deze technieken voorkomen het kleine-bestandenprobleem en versnellen analytische queries.
Hoofdstuk 3VerbergenVerberg detailsBekijk detailsDatabronnen en Pipelines
Databronnen en Pipelines
Les 1 • Pipeline-betrouwbaarheid en -monitoring
Leert dead-letter queues, datakwaliteitscontroles bij opname en pipeline-observeerbaarheid. Betrouwbare pipelines voorkomen stille dataverlies en stroomafwaartse corruptie.
Les 2 • Grondslagen van Streaming-opname
Introduceert event streaming-concepten, message brokers en exactly-once-semantiek. Streaming-opname maakt bijna-realtime analytics mogelijk op continu binnenkomende data.
Les 3 • Overzicht van Opname-architectuur
Koppelt opnamepatronen aan brontypes en latentie-eisen. Dit overzicht kadert de ontwerpkeuzes die in het hoofdstuk worden behandeld.
Les 4 • Opname uit Diverse Brontypen
Behandelt databases, API's, bestanden, IoT-apparaten en SaaS-platforms als opnamebronnen. Elk brontype vereist specifieke connectors en strategieën voor schemaverwerking.
Les 5 • Ontwerp van Batch-opname
Behandelt geplande extractie, volledige versus incrementele ladingen en change data capture. Batch-opname blijft het meest voorkomende patroon voor gestructureerde bronsystemen.
Hoofdstuk 4VerbergenVerberg detailsBekijk detailsData Lake-organisatie en Metadatabeheer
Data Lake-organisatie en Metadatabeheer
Les 1 • Technische en Bedrijfsmetadata
Differentieert technische metadata (schema, lineage) van bedrijfsmetadata (eigenaarschap, woordenlijst). Beide typen zijn nodig voor effectieve datavindbaarheid en -governance.
Les 2 • Op Zones Gebaseerde Lake-architectuur
Introduceert ruwe, opgeschoonde, gecureerde en sandbox-zones met duidelijke promotiecriteria. Zone-scheiding handhaaft datakwaliteitsgrenzen en toegangscontrole.
Les 3 • Data Lineage-tracking
Legt kolom- en datasetniveau lineage-captatie en -visualisatie uit. Lineage maakt impactanalyse mogelijk en bouwt vertrouwen van consumenten in data-assets.
Les 4 • Naamgevingsconventies en Mapstructuren
Stelt standaarden vast voor bucketnamen, prefixes en dataset-ID's. Consistente naamgeving maakt automatisering, vindbaarheid en governance op schaal mogelijk.
Les 5 • Ontwerp en Implementatie van Datacatalogus
Behandelt catalogusarchitectuur, crawlers en zoekinterfaces voor datasetvindbaarheid. Een goed ontworpen catalogus verkort de tijd tot inzicht voor data-consumenten.
Hoofdstuk 5VerbergenVerberg detailsBekijk detailsDatagovernance en Beveiliging in Data Lakes
Datagovernance en Beveiliging in Data Lakes
Les 1 • Toegangscontrolmodellen voor Data Lakes
Vergelijkt op rollen gebaseerde, op attributen gebaseerde en op rij-/kolomniveau gebaseerde toegangscontrolmodellen. De juiste modelkeuze balanceert beveiliging met operationele flexibiliteit.
Les 2 • Data Masking en Anonimisering
Behandelt statische masking, dynamische masking, tokenisatie en pseudonimiseringstechnieken. Deze methoden beschermen gevoelige data terwijl de analytische bruikbaarheid behouden blijft.
Les 3 • Encryptie in Rust en onderweg
Legt server-side encryptie, client-side encryptie en TLS voor data in transit uit. Encryptie is de basiscontrole voor het beschermen van lake-data tegen ongeautoriseerde toegang.
Les 4 • Auditlogging en Nalevingsrapportage
Ontwerpt auditlog-pipelines, bewaarbeleid en nalevingsdashboards. Audittrails tonen de effectiviteit van controles aan interne en externe beoordelaars.
Les 5 • Dataclassificatie en Gevoeligheidstaggings
Definieert classificatieniveaus – openbaar, intern, vertrouwelijk, beperkt – en tagging-werkstromen. Classificatie stuurt stroomafwaartse toegangs- en masking-beslissingen.
Hoofdstuk 6VerbergenVerberg detailsBekijk detailsDataverwerking en Transformatie op Schaal
Dataverwerking en Transformatie op Schaal
Les 1 • Grondslagen van Gedistribueerde Verwerking
Introduceert gedistribueerde executiemodellen, DAG's en shuffle-operaties. Inzicht in deze mechanismen is een voorwaarde voor het optimaliseren van elke grootschalige transformatiejob.
Les 2 • Transformatie voor Datakwaliteit
Implementeert validatie, standaardisatie, deduplicatie en verrijking als transformatiestappen. Het inbedden van kwaliteitsregels in pipelines voorkomt dat slechte data consumenten bereikt.
Les 3 • Pipeline-prestatieoptimalisatie
Past caching, partitiepruning, predicate pushdown en jobafstemming toe om de looptijd te verkorten. Geoptimaliseerde pipelines verlagen de computekosten en voldoen aan SLA-eisen.
Les 4 • Streaming Transformatiepatronen
Leert stateful stream processing, watermarks en afhandeling van laat arriverende data. Streaming-transformaties maken continue analytics op real-time datastromen mogelijk.
Les 5 • Batch Transformatiepatronen
Behandelt filter-, join-, aggregatie- en vensterbewerkingen op grote datasets. Deze patronen vormen de bouwstenen van alle analytische transformatiepipelines.
Hoofdstuk 7VerbergenVerberg detailsBekijk detailsOpen Tabelformaten en Lakehouse-architectuur
Open Tabelformaten en Lakehouse-architectuur
Les 1 • Ontwerp van Lakehouse-architectuur
Integreert open tabelformaten met query-engines, BI-tools en ML-platforms in één unified lakehouse. Deze architectuur elimineert in veel scenario's de noodzaak van een apart datawarehouse.
Les 2 • Apache Iceberg en Apache Hudi
Vergelijkt de verborgen partitioning van Iceberg en de upserts op recordniveau van Hudi met Delta Lake. Studenten selecteren het juiste formaat op basis van workload- en ecosysteemeisen.
Les 3 • Beperkingen van Traditionele Data Lakes
Identificeert consistentie-, update- en time-travel- gaten in plain object store-lakes. Deze beperkingen motiveren de adoptie van open tabelformaten.
Les 4 • Concepten van Open Tabelformaten
Legt metadatalagen, transactielogs en snapshot-isolatie uit die gemeenschappelijk zijn voor alle open formaten. Een gedeeld conceptueel model vereenvoudigt de vergelijking van specifieke implementaties.
Les 5 • Delta Lake Diepgaand
Behandelt Delta-log-mechanismen, MERGE-operaties, Z-ordering en vacuum-commando's. Delta Lake is breed geadopteerd en dient als primaire implementatiereferentie.
Hoofdstuk 8VerbergenVerberg detailsBekijk detailsData Lake-operaties en Strategische Governance
Data Lake-operaties en Strategische Governance
Les 1 • Dataretentie en Levenscyclus-governance
Ontwerpt retentieschema's, verwijderingsworkflows en wettelijke bewaarprocessen. Levenscyclus-governance vermindert risico's en opslagkosten terwijl wordt voldaan aan wettelijke verplichtingen.
Les 2 • Data Mesh en Gefedereerd Eigenaarschap
Past data mesh-principes – domeineigenaarschap, dataproducten en gefedereerde governance – toe op grote lakes. Gefedereerde modellen schalen governance voorbij de capaciteit van een centraal team.
Les 3 • Routekaartplanning en Maturiteitsbeoordeling
Gebruikt maturiteitsmodellen om de huidige lake-capaciteiten te beoordelen en verbeterinitiatieven te prioriteren. Een gestructureerde routekaart stemt technische investeringen af op de bedrijfsstrategie.
Les 4 • Kostenbeheer en FinOps voor Data Lakes
Past tagging, showback, chargeback en rightsizing toe om lake-uitgaven te beheersen. Kosteninzicht bevordert verantwoordelijkheid en voorkomt ongecontroleerde groei van opslag en compute.
Les 5 • Observeerbaarheid en Monitoring
Bouwt monitoringstacks voor pipelinegezondheid, datafreshness en opslagmetrieken. Observeerbaarheid maakt proactieve probleemoplossing mogelijk voordat consumenten worden getroffen.
Jouw geldig certificaat van voltooiing
Deze cursus is voor jou:
Data-ingenieurs die verder willen gaan dan eenvoudig pipelinewerk.
Cloudarchitecten die schaalbare opslagoplossingen ontwerpen voor analyseteams.
BI-ontwikkelaars wiens rapportagebehoeften de grenzen van traditionele datawarehouses overstijgen.
Software-ingenieurs die overstappen naar data-infrastructuur- en platformrollen.
IT-managers die toezicht houden op datastrategie en snel technische diepgang nodig hebben.
Analytics-ingenieurs die reproduceerbare, ML-gereed datasets bouwen uit ruwe bronnen.
Wat onze studenten zeggen
Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...

Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.

Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!

Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.

Belangrijkste opleidingen
FAQ
Wie is Dedika?
Is het certificaat geldig in Nederland?
Zijn de cursussen gratis?
Wat is de studielast van de cursus?
Hoe zien de cursussen eruit?
Hoe werken de cursussen?
Wat is de duur van de cursussen?
Wat zijn de kosten of prijzen van de cursussen?
Wat is een EAD- of online cursus en hoe werkt het?
PDF-cursus




















