
Big Data Engineer Cursus
Beheers de volledige big data-engineeringstack – van gedistribueerde opslag en Apache Spark tot realtime-streaming met Kafka en Flink. Deze cursus geeft je de praktische vaardigheden om productierijke datapipelines op schaal te ontwerpen, bouwen en beheren. Als je serieus bent over een carrière in data-engineering, begin je hier.
Wat je gaat leren:
Je bouwt een diepgaand begrip op van big data-fundamentals, gedistribueerde opslag met HDFS en cloud-objectopslagintegratie. Je ontwikkelt productierijke batchverwerkingsjobs met Apache Spark en realtime-pipelines met Apache Flink en Spark Structured Streaming. De cursus behandelt data-inname met Kafka en Change Data Capture, warehouse- en lakehouse-ontwerp met Delta Lake, Iceberg en dbt, en volledige pipeline-orchestratie met Apache Airflow. Je doet ook praktische vaardigheden op in Kubernetes-implementatie, datagovernance en ML-infrastructuur. Aan het einde heb je de technische diepgang en tooling-breedte die moderne data-engineeringrollen vereisen.
Hoe je praktisch studeert Big Data Engineer Cursus
Hoe je oefent Big Data Engineer Cursus
Voor bedrijven die hun team willen trainen
Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.
Cursusinhoud
8 Hoofdstukken • 38 LessenDuur tussen 4 en 360 uren (jij beslist)
Hoofdstuk 1VerbergenVerberg detailsBekijk detailsBig Data-fundamenten en ecosysteem
Big Data-fundamenten en ecosysteem
Les 1 • Rol en verantwoordelijkheden van de data-engineer
Definieert de scope van de data-engineer versus data scientists en analisten. Verduidelijkt het eigenaarschap van pipelines, betrouwbaarheid en datakwaliteit.
Les 2 • Big Data-architectuurpatronen
Introduceert Lambda- en Kappa-architecturen en hun afwegingen. Biedt de structurele context voor alle pipeline-ontwerpen die later aan bod komen.
Les 3 • Big Data definiëren en de dimensies ervan
Behandelt het 5 Vs-framework en drijfveren voor datagroei in de praktijk. Vestigt de woordenschat die in de hele cursus wordt gebruikt.
Les 4 • De moderne data-engineering-stack
Koppelt de belangrijkste toolcategorieën – opname, opslag, verwerking en orkestratie – aan engineeringrollen. Studenten krijgen een mentaal model voor de volledige cursus.
Hoofdstuk 2VerbergenVerberg detailsBekijk detailsLinux-, netwerk- en cloudbasisprincipes
Linux-, netwerk- en cloudbasisprincipes
Les 1 • Netwerkconcepten voor data-engineers
Legt TCP/IP, DNS, poorten en firewalls uit in de context van gedistribueerde systemen. Stelt studenten in staat connectiviteitsproblemen in clusteromgevingen op te lossen.
Les 2 • Basisprincipes van cloudinfrastructuur
Introduceert reken-, opslag- en netwerkprimitieven voor de belangrijkste cloudproviders. Studenten kunnen virtuele machines en objectopslagbuckets implementeren en configureren.
Les 3 • Containerisatie met Docker
Leert het bouwen en uitvoeren van containers voor reproduceerbare data-engineeringomgevingen. Containers worden gebruikt in praktijkopdrachten vanaf het volgende hoofdstuk.
Les 4 • Essentiële Linux-commandoregelvaardigheden
Behandelt navigatie in het bestandssysteem, machtigingen en basisprincipes van shell-scripting. Deze vaardigheden vormen de basis voor clusterbeheer en automatiseringstaken in de cursus.
Hoofdstuk 3VerbergenVerberg detailsBekijk detailsGedistribueerde opslag en HDFS
Gedistribueerde opslag en HDFS
Les 1 • HDFS-architectuur en interne werking
Legt de rollen van NameNode en DataNode, blokreplicatie en fouttolerantie uit. Biedt de opslagbasis die vereist is voordat verwerkingsframeworks worden geïntroduceerd.
Les 2 • Dataformaten voor gedistribueerde opslag
Vergelijkt rijgebaseerde en kolomgebaseerde formaten, waaronder Avro, Parquet en ORC. Formaatkeuze heeft directe invloed op de queryprestaties in latere verwerkingshoofdstukken.
Les 3 • Integratie van cloud-objectopslag
Demonstreert het gebruik van cloud-objectopslag als een directe vervanging van HDFS. Bereidt studenten voor op cloud-native pipeline-architecturen die later worden geïntroduceerd.
Les 4 • Ontwerpprincipes voor data lakes
Introduceert zonegebaseerde data lake-architectuur: ruwe, gecureerde en consumptielagen. Studenten ontwerpen opslaglay-outs die stroomafwaartse analyse-pipelines ondersteunen.
Les 5 • HDFS-operaties en -beheer
Behandelt HDFS CLI, quotabeheer en clustergezondheidsmonitoring. Studenten doen praktische vaardigheden op voor dagelijks opslagbeheer.
Hoofdstuk 4VerbergenVerberg detailsBekijk detailsBatchverwerking met Apache Spark
Batchverwerking met Apache Spark
Les 1 • Prestatieoptimalisatie van Spark
Behandelt partitionering, caching, serialisatie en geheugenbeheer voor productietaken. Studenten verkorten de looptijd van taken en verlagen de resourcekosten aanzienlijk.
Les 2 • Spark-architectuur en uitvoeringsmodel
Legt driver, executor, DAG-scheduler en taakuitvoering uit. Inzicht in de interne werking is een vereiste voor het schrijven van efficiënte Spark-code.
Les 3 • RDD's, DataFrames en Datasets
Behandelt de drie Spark-abstractielagen en wanneer je ze gebruikt. Bouwt van laag-niveau RDD-bewerkingen naar hoog-niveau DataFrame-transformaties.
Les 4 • Spark SQL en datamanipulatie
Leert SQL-queries, vensterfuncties en complexe aggregaties op DataFrames. Stelt analisten die engineer zijn geworden in staat om bestaande SQL-vaardigheden in Spark te gebruiken.
Les 5 • Gegevensbronnen lezen en schrijven
Behandelt connectoren voor HDFS, objectopslag, JDBC, Kafka en Delta Lake. Verbindt Spark met de opslag- en streaminglagen die in eerdere hoofdstukken zijn gebouwd.
Hoofdstuk 5VerbergenVerberg detailsBekijk detailsData-opname- en berichtensystemen
Data-opname- en berichtensystemen
Les 1 • Batchopname met Apache Sqoop en alternatieven
Behandelt bulkextractie uit relationele databases met Sqoop en moderne alternatieven. Completeert de opnametoolkit voor zowel streaming- als batchbronsystemen.
Les 2 • Berichten produceren en consumeren
Behandelt producer-bevestigingsinstellingen, consumer-offsetbeheer en exactly-once-semantiek. Studenten schrijven betrouwbare producers en consumers in Python en Java.
Les 3 • Change Data Capture-technieken
Introduceert CDC met databasetransactielogs om wijzigingen op rijniveau vast te leggen. Maakt bijna real-time synchronisatie mogelijk tussen operationele databases en de data lake.
Les 4 • Apache Kafka-architectuur
Legt brokers, topics, partities, consumergroepen en replicatie uit. Deze architectuur vormt de basis voor alle streaming-pipelines die in volgende hoofdstukken worden gebouwd.
Les 5 • Kafka Connect voor batchopname
Demonstreert bron- en sinkconnectoren voor databases, objectopslag en bestandssystemen. Vermindert aangepaste code voor veelvoorkomende opnamepatronen.
Hoofdstuk 6VerbergenVerberg detailsBekijk detailsStreamverwerking met Apache Flink en Spark Streaming
Streamverwerking met Apache Flink en Spark Streaming
Les 1 • Betrouwbaarheid en monitoring van streaming-pipelines
Behandelt backpressure, consumer-lag, herstel na fouten en alerting voor streamingtaken. Zorgt ervoor dat studenten streaming-pipelines in productie kunnen beheren.
Les 2 • Apache Flink-architectuur en API's
Behandelt Flink's JobManager, TaskManager, DataStream API en Table API. Studenten schrijven stateful streamingtaken met exactly-once-garanties.
Les 3 • Basisprincipes van streamverwerking
Definieert event time, processing time, watermarks en windowing-semantiek. Deze concepten zijn een vereiste voor het schrijven van correcte streamingtoepassingen.
Les 4 • Spark Structured Streaming
Leert de micro-batch- en continue-verwerkingsmodi van Spark Structured Streaming. Maakt gebruik van bestaande Spark DataFrame-vaardigheden voor streaming-workloads.
Les 5 • Stateful stroomverwerkingspatronen
Implementeert deduplicatie, sessievorming en patroondetectie met managed state. Bereidt studenten voor op complexe streaming use cases in de praktijk.
Hoofdstuk 7VerbergenVerberg detailsBekijk detailsDatawarehouse- en lakehouse-architecturen
Datawarehouse- en lakehouse-architecturen
Les 1 • Cloud datawarehouse-platforms
Vergelijkt MPP-cloudwarehouse-architecturen en hun modellen voor opslag-computerseparatie. Studenten laden, transformeren en doorzoeken grote datasets met warehouse-SQL.
Les 2 • Apache Iceberg- en Hudi-formaten
Behandelt Iceberg's verborgen partitionering en Hudi's upsert-mogelijkheden als alternatieven voor Delta Lake. Studenten selecteren het juiste open tabelformaat voor hun use case.
Les 3 • Delta Lake en tabelformaten
Introduceert ACID-transacties, time travel en schema-enforcement in Delta Lake. Overbrugt de kloof tussen ruwe data lake-opslag en warehouse-grade betrouwbaarheid.
Les 4 • Basisprincipes van datawarehouse-modellering
Behandelt sterschema, sneeuwvlokschema, langzaam veranderende dimensies en feitentabelontwerp. Biedt de modelleringswoordenschat die wordt gebruikt in warehouse- en lakehouse-implementaties.
Les 5 • ELT-transformatie met dbt
Leert het bouwen van modulaire SQL-transformatie-pipelines met dbt in het warehouse. Verbindt ruwe opgenomen data met analyseklare modellen.
Hoofdstuk 8VerbergenVerberg detailsBekijk detailsPipeline-orkestratie en DataOps
Pipeline-orkestratie en DataOps
Les 1 • Apache Airflow-architectuur en DAG's
Behandelt Airflow's scheduler, executor, metadata-database en DAG-creatie. Legt de orkestratiebasis voor alle pipeline-automatisering in dit hoofdstuk.
Les 2 • CI/CD en infrastructuur als code voor pipelines
Past Git-workflows, geautomatiseerd testen en Terraform toe op pipeline-implementatie. Studenten leveren wijzigingen veilig en herhaalbaar in productie.
Les 3 • Geavanceerde DAG-ontwerppatronen
Leert dynamische DAG-generatie, branching en cross-DAG-afhankelijkheden. Stelt studenten in staat flexibele, herbruikbare orkestratiepatronen te bouwen.
Les 4 • Datakwaliteit en pipeline-testen
Implementeert datakwaliteitscontroles met Great Expectations en dbt-tests in pipelines. Voorkomt dat slechte data wordt doorgegeven aan stroomafwaartse consumenten.
Les 5 • Moderne orkestratie met Prefect en Dagster
Introduceert Prefect-flows en Dagster-assets als alternatieven voor Airflow. Studenten evalueren orkestratietools op basis van pipeline-complexiteit en teambehoeften.
Jouw geldig certificaat van voltooiing
Deze cursus is voor jou:
Softwareontwikkelaars die klaar zijn om te specialiseren in grootschalige data-infrastructuurrollen.
Data-analisten die stroomopwaarts willen gaan en de pipelines willen beheren waarvan ze afhankelijk zijn.
Backend-ingenieurs die nieuwsgierig zijn naar gedistribueerde systemen en realtime-dataverwerking.
Afgestudeerden in de informatica die zich richten op veelgevraagde data-engineeringposities.
DevOps-professionals die willen uitbreiden naar cloud-native dataplatform-engineering.
BI-ontwikkelaars die diepere technische eigenaarschap willen, verder dan dashboards en rapporten.
Wat onze studenten zeggen
Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...

Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.

Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!

Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.

Belangrijkste opleidingen
FAQ
Wie is Dedika?
Is het certificaat geldig in Nederland?
Zijn de cursussen gratis?
Wat is de studielast van de cursus?
Hoe zien de cursussen eruit?
Hoe werken de cursussen?
Wat is de duur van de cursussen?
Wat zijn de kosten of prijzen van de cursussen?
Wat is een EAD- of online cursus en hoe werkt het?
PDF-cursus




















