Kies uw taal
Big Data Engineer Cursus
Meer dan 2 miljoen studenten wereldwijd

Big Data Engineer Cursus

Beheers de volledige big data-engineeringstack – van gedistribueerde opslag en Apache Spark tot realtime-streaming met Kafka en Flink. Deze cursus geeft je de praktische vaardigheden om productierijke datapipelines op schaal te ontwerpen, bouwen en beheren. Als je serieus bent over een carrière in data-engineering, begin je hier.

Dedika voor bedrijven

Wat je gaat leren:

Je bouwt een diepgaand begrip op van big data-fundamentals, gedistribueerde opslag met HDFS en cloud-objectopslagintegratie. Je ontwikkelt productierijke batchverwerkingsjobs met Apache Spark en realtime-pipelines met Apache Flink en Spark Structured Streaming. De cursus behandelt data-inname met Kafka en Change Data Capture, warehouse- en lakehouse-ontwerp met Delta Lake, Iceberg en dbt, en volledige pipeline-orchestratie met Apache Airflow. Je doet ook praktische vaardigheden op in Kubernetes-implementatie, datagovernance en ML-infrastructuur. Aan het einde heb je de technische diepgang en tooling-breedte die moderne data-engineeringrollen vereisen.

Hoe je praktisch studeert Big Data Engineer Cursus

Hoe je oefent Big Data Engineer Cursus

Voor bedrijven die hun team willen trainen

Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.

Klik hier

Cursusinhoud

8 Hoofdstukken • 38 LessenDuur tussen 4 en 360 uren (jij beslist)

Hoofdstuk 1Bekijk details

Big Data-fundamenten en ecosysteem

  • Les 1 • Rol en verantwoordelijkheden van de data-engineer

    Definieert de scope van de data-engineer versus data scientists en analisten. Verduidelijkt het eigenaarschap van pipelines, betrouwbaarheid en datakwaliteit.

  • Les 2 • Big Data-architectuurpatronen

    Introduceert Lambda- en Kappa-architecturen en hun afwegingen. Biedt de structurele context voor alle pipeline-ontwerpen die later aan bod komen.

  • Les 3 • Big Data definiëren en de dimensies ervan

    Behandelt het 5 Vs-framework en drijfveren voor datagroei in de praktijk. Vestigt de woordenschat die in de hele cursus wordt gebruikt.

  • Les 4 • De moderne data-engineering-stack

    Koppelt de belangrijkste toolcategorieën – opname, opslag, verwerking en orkestratie – aan engineeringrollen. Studenten krijgen een mentaal model voor de volledige cursus.

Hoofdstuk 2Bekijk details

Linux-, netwerk- en cloudbasisprincipes

  • Les 1 • Netwerkconcepten voor data-engineers

    Legt TCP/IP, DNS, poorten en firewalls uit in de context van gedistribueerde systemen. Stelt studenten in staat connectiviteitsproblemen in clusteromgevingen op te lossen.

  • Les 2 • Basisprincipes van cloudinfrastructuur

    Introduceert reken-, opslag- en netwerkprimitieven voor de belangrijkste cloudproviders. Studenten kunnen virtuele machines en objectopslagbuckets implementeren en configureren.

  • Les 3 • Containerisatie met Docker

    Leert het bouwen en uitvoeren van containers voor reproduceerbare data-engineeringomgevingen. Containers worden gebruikt in praktijkopdrachten vanaf het volgende hoofdstuk.

  • Les 4 • Essentiële Linux-commandoregelvaardigheden

    Behandelt navigatie in het bestandssysteem, machtigingen en basisprincipes van shell-scripting. Deze vaardigheden vormen de basis voor clusterbeheer en automatiseringstaken in de cursus.

Hoofdstuk 3Bekijk details

Gedistribueerde opslag en HDFS

  • Les 1 • HDFS-architectuur en interne werking

    Legt de rollen van NameNode en DataNode, blokreplicatie en fouttolerantie uit. Biedt de opslagbasis die vereist is voordat verwerkingsframeworks worden geïntroduceerd.

  • Les 2 • Dataformaten voor gedistribueerde opslag

    Vergelijkt rijgebaseerde en kolomgebaseerde formaten, waaronder Avro, Parquet en ORC. Formaatkeuze heeft directe invloed op de queryprestaties in latere verwerkingshoofdstukken.

  • Les 3 • Integratie van cloud-objectopslag

    Demonstreert het gebruik van cloud-objectopslag als een directe vervanging van HDFS. Bereidt studenten voor op cloud-native pipeline-architecturen die later worden geïntroduceerd.

  • Les 4 • Ontwerpprincipes voor data lakes

    Introduceert zonegebaseerde data lake-architectuur: ruwe, gecureerde en consumptielagen. Studenten ontwerpen opslaglay-outs die stroomafwaartse analyse-pipelines ondersteunen.

  • Les 5 • HDFS-operaties en -beheer

    Behandelt HDFS CLI, quotabeheer en clustergezondheidsmonitoring. Studenten doen praktische vaardigheden op voor dagelijks opslagbeheer.

Hoofdstuk 4Bekijk details

Batchverwerking met Apache Spark

  • Les 1 • Prestatieoptimalisatie van Spark

    Behandelt partitionering, caching, serialisatie en geheugenbeheer voor productietaken. Studenten verkorten de looptijd van taken en verlagen de resourcekosten aanzienlijk.

  • Les 2 • Spark-architectuur en uitvoeringsmodel

    Legt driver, executor, DAG-scheduler en taakuitvoering uit. Inzicht in de interne werking is een vereiste voor het schrijven van efficiënte Spark-code.

  • Les 3 • RDD's, DataFrames en Datasets

    Behandelt de drie Spark-abstractielagen en wanneer je ze gebruikt. Bouwt van laag-niveau RDD-bewerkingen naar hoog-niveau DataFrame-transformaties.

  • Les 4 • Spark SQL en datamanipulatie

    Leert SQL-queries, vensterfuncties en complexe aggregaties op DataFrames. Stelt analisten die engineer zijn geworden in staat om bestaande SQL-vaardigheden in Spark te gebruiken.

  • Les 5 • Gegevensbronnen lezen en schrijven

    Behandelt connectoren voor HDFS, objectopslag, JDBC, Kafka en Delta Lake. Verbindt Spark met de opslag- en streaminglagen die in eerdere hoofdstukken zijn gebouwd.

Hoofdstuk 5Bekijk details

Data-opname- en berichtensystemen

  • Les 1 • Batchopname met Apache Sqoop en alternatieven

    Behandelt bulkextractie uit relationele databases met Sqoop en moderne alternatieven. Completeert de opnametoolkit voor zowel streaming- als batchbronsystemen.

  • Les 2 • Berichten produceren en consumeren

    Behandelt producer-bevestigingsinstellingen, consumer-offsetbeheer en exactly-once-semantiek. Studenten schrijven betrouwbare producers en consumers in Python en Java.

  • Les 3 • Change Data Capture-technieken

    Introduceert CDC met databasetransactielogs om wijzigingen op rijniveau vast te leggen. Maakt bijna real-time synchronisatie mogelijk tussen operationele databases en de data lake.

  • Les 4 • Apache Kafka-architectuur

    Legt brokers, topics, partities, consumergroepen en replicatie uit. Deze architectuur vormt de basis voor alle streaming-pipelines die in volgende hoofdstukken worden gebouwd.

  • Les 5 • Kafka Connect voor batchopname

    Demonstreert bron- en sinkconnectoren voor databases, objectopslag en bestandssystemen. Vermindert aangepaste code voor veelvoorkomende opnamepatronen.

Hoofdstuk 6Bekijk details

Streamverwerking met Apache Flink en Spark Streaming

  • Les 1 • Betrouwbaarheid en monitoring van streaming-pipelines

    Behandelt backpressure, consumer-lag, herstel na fouten en alerting voor streamingtaken. Zorgt ervoor dat studenten streaming-pipelines in productie kunnen beheren.

  • Les 2 • Apache Flink-architectuur en API's

    Behandelt Flink's JobManager, TaskManager, DataStream API en Table API. Studenten schrijven stateful streamingtaken met exactly-once-garanties.

  • Les 3 • Basisprincipes van streamverwerking

    Definieert event time, processing time, watermarks en windowing-semantiek. Deze concepten zijn een vereiste voor het schrijven van correcte streamingtoepassingen.

  • Les 4 • Spark Structured Streaming

    Leert de micro-batch- en continue-verwerkingsmodi van Spark Structured Streaming. Maakt gebruik van bestaande Spark DataFrame-vaardigheden voor streaming-workloads.

  • Les 5 • Stateful stroomverwerkingspatronen

    Implementeert deduplicatie, sessievorming en patroondetectie met managed state. Bereidt studenten voor op complexe streaming use cases in de praktijk.

Hoofdstuk 7Bekijk details

Datawarehouse- en lakehouse-architecturen

  • Les 1 • Cloud datawarehouse-platforms

    Vergelijkt MPP-cloudwarehouse-architecturen en hun modellen voor opslag-computerseparatie. Studenten laden, transformeren en doorzoeken grote datasets met warehouse-SQL.

  • Les 2 • Apache Iceberg- en Hudi-formaten

    Behandelt Iceberg's verborgen partitionering en Hudi's upsert-mogelijkheden als alternatieven voor Delta Lake. Studenten selecteren het juiste open tabelformaat voor hun use case.

  • Les 3 • Delta Lake en tabelformaten

    Introduceert ACID-transacties, time travel en schema-enforcement in Delta Lake. Overbrugt de kloof tussen ruwe data lake-opslag en warehouse-grade betrouwbaarheid.

  • Les 4 • Basisprincipes van datawarehouse-modellering

    Behandelt sterschema, sneeuwvlokschema, langzaam veranderende dimensies en feitentabelontwerp. Biedt de modelleringswoordenschat die wordt gebruikt in warehouse- en lakehouse-implementaties.

  • Les 5 • ELT-transformatie met dbt

    Leert het bouwen van modulaire SQL-transformatie-pipelines met dbt in het warehouse. Verbindt ruwe opgenomen data met analyseklare modellen.

Hoofdstuk 8Bekijk details

Pipeline-orkestratie en DataOps

  • Les 1 • Apache Airflow-architectuur en DAG's

    Behandelt Airflow's scheduler, executor, metadata-database en DAG-creatie. Legt de orkestratiebasis voor alle pipeline-automatisering in dit hoofdstuk.

  • Les 2 • CI/CD en infrastructuur als code voor pipelines

    Past Git-workflows, geautomatiseerd testen en Terraform toe op pipeline-implementatie. Studenten leveren wijzigingen veilig en herhaalbaar in productie.

  • Les 3 • Geavanceerde DAG-ontwerppatronen

    Leert dynamische DAG-generatie, branching en cross-DAG-afhankelijkheden. Stelt studenten in staat flexibele, herbruikbare orkestratiepatronen te bouwen.

  • Les 4 • Datakwaliteit en pipeline-testen

    Implementeert datakwaliteitscontroles met Great Expectations en dbt-tests in pipelines. Voorkomt dat slechte data wordt doorgegeven aan stroomafwaartse consumenten.

  • Les 5 • Moderne orkestratie met Prefect en Dagster

    Introduceert Prefect-flows en Dagster-assets als alternatieven voor Airflow. Studenten evalueren orkestratietools op basis van pipeline-complexiteit en teambehoeften.

Certificering

Jouw geldig certificaat van voltooiing

Deze cursus is voor jou:

  • Softwareontwikkelaars die klaar zijn om te specialiseren in grootschalige data-infrastructuurrollen.

  • Data-analisten die stroomopwaarts willen gaan en de pipelines willen beheren waarvan ze afhankelijk zijn.

  • Backend-ingenieurs die nieuwsgierig zijn naar gedistribueerde systemen en realtime-dataverwerking.

  • Afgestudeerden in de informatica die zich richten op veelgevraagde data-engineeringposities.

  • DevOps-professionals die willen uitbreiden naar cloud-native dataplatform-engineering.

  • BI-ontwikkelaars die diepere technische eigenaarschap willen, verder dan dashboards en rapporten.

Wat onze studenten zeggen

Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...
Giulio Carlo
Giulio CarloStudent Digitale Marketing
Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.
Mariana Ferres
Mariana FerresStudent Fotografie
Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!
Luciana Alvarenga
Luciana AlvarengaStudent Nageldesign
Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.
André Felipe
André FelipeStudent Prompt Engineering

Belangrijkste opleidingen

FAQ

Wie is Dedika?

Is het certificaat geldig in Nederland?

Zijn de cursussen gratis?

Wat is de studielast van de cursus?

Hoe zien de cursussen eruit?

Hoe werken de cursussen?

Wat is de duur van de cursussen?

Wat zijn de kosten of prijzen van de cursussen?

Wat is een EAD- of online cursus en hoe werkt het?

PDF-cursus