
Cursus Python Data Engineering
Beheers de Python-vaardigheden die data-engineers dagelijks gebruiken — van het bouwen van ETL-pijplijnen en het verbinden met databases tot het orkestreren van workflows en het implementeren van productieklaar code. Deze cursus neemt je mee van de basisprincipes van Python tot geavanceerde data-engineeringpatronen die op schaal worden gebruikt.
Wat je gaat leren:
Je leert Python-scripts schrijven die gegevens uit API's, bestanden en databases halen, deze vervolgens transformeren en laden in relationele databases, datawarehouses en cloudopslag. Je werkt met Pandas voor gegevensmanipulatie, SQLAlchemy voor databaseconnectiviteit en Apache Airflow voor pijplijnorkestratie. De cursus behandelt gegevenskwaliteitsvalidatie, prestatieoptimalisatie, parallelle verwerking en CI/CD-praktijken voor pijplijnimplementatie. Je verkent ook PySpark voor gedistribueerde verwerking, Kafka voor streamingpijplijnen en beveiligingsbest practices voor het beschermen van gevoelige gegevens in productieomgevingen.
Hoe je praktisch studeert Cursus Python Data Engineering
Hoe je oefent Cursus Python Data Engineering
Voor bedrijven die hun team willen trainen
Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.
Cursusinhoud
8 Hoofdstukken • 37 LessenDuur tussen 4 en 360 uren (jij beslist)
Hoofdstuk 1VerbergenVerberg detailsBekijk detailsPython Foundations voor Data Engineers
Python Foundations voor Data Engineers
Les 1 • Control Flow en Iteratie
Pas conditionals, loops en comprehensions toe om reeksen gegevensrecords te verwerken. Dit is direct toepasbaar op de transformatielogica op rijniveau die in ETL-pipelines wordt gebruikt.
Les 2 • Functies en Foutafhandeling
Definieer herbruikbare functies met argumenten, standaardwaarden en retourwaarden en handel vervolgens uitzonderingen netjes af. Maakt modulaire, fouttolerante pijplijncode mogelijk.
Les 3 • Kern Python-syntax en gegevenstypen
Dek variabelen, operatoren en ingebouwde typen af, waaronder strings, integers, floats en booleans. Dit vormt de syntactische basis voor het schrijven van logica voor gegevenspijplijnen.
Les 4 • Collecties: Lijsten, Tuples, Dicts, Sets
Verken veranderlijke en onveranderlijke collectietypen en hun prestatieafwegingen. Deze structuren vormen de basis voor gegevensmanipulatie in het geheugen gedurende de hele cursus.
Les 5 • De Python-omgeving instellen
Installeer Python, configureer virtuele omgevingen en selecteer een IDE die geschikt is voor datawerk. Dit creëert de reproduceerbare werkruimte waar alle volgende hoofdstukken van afhankelijk zijn.
Hoofdstuk 2VerbergenVerberg detailsBekijk detailsBestands I/O en gegevensserialisatie
Bestands I/O en gegevensserialisatie
Les 1 • Binaire formaten: Parquet en Avro
Lees en schrijf kolomgeoriënteerde Parquet- en rijgebaseerde Avro-bestanden met Python-bibliotheken. Deze formaten zijn standaard in moderne data lake-architecturen.
Les 2 • Werken met tekst- en CSV-bestanden
Open, lees en schrijf tekstbestanden met contextmanagers en parseer vervolgens CSV met de standaardbibliotheek. Dit behandelt het meest voorkomende ruwe gegevensformaat in batchpijplijnen.
Les 3 • Bestandssysteem- en padbewerkingen
Navigeer door mappen, gebruik glob voor bestanden en beheer paden met de modules pathlib en os. Automatiseert stappen voor het vinden van bestanden die gebruikelijk zijn in batch-opnameworkflows.
Les 4 • JSON- en XML-gegevensformaten
Parseer en serialiseer JSON-payloads en navigeer door XML-bomen voor het verwerken van API's en configuratiebestanden. Dit sluit aan bij realistische opname van REST API-antwoorden.
Hoofdstuk 3VerbergenVerberg detailsBekijk detailsGegevensmanipulatie met Pandas
Gegevensmanipulatie met Pandas
Les 1 • DataFrames en Series basisbeginselen
Maak DataFrames van dicts, CSV en JSON en inspecteer vervolgens de structuur en gegevenstypen. Vormt de basis voor al het op Pandas gebaseerde transformatiewerk.
Les 2 • Filteren, sorteren en selecteren
Pas booleaanse masks, loc/iloc selectors en sorteerbewerkingen toe om relevante gegevenssubsets te isoleren. Ondersteunt direct het filteren van gegevenskwaliteit in pijplijnfasen.
Les 3 • Aggregatie, groeperen en draaien
Vat gegevens samen met groupby, agg en pivot-bewerkingen om analytische uitvoer te produceren. Maakt berekening van metrieken en rapportage binnen pijplijnworkflows mogelijk.
Les 4 • Gegevens opschonen en type-coercie
Ga om met ontbrekende waarden, duplicaten en onjuiste typen om schone, consistente datasets te produceren. Opschonen is de meest tijdrovende stap in realistische gegevenspijplijnen.
Les 5 • DataFrames samenvoegen en joinen
Combineer datasets met merge, join en concat om SQL-achtige relationele logica te repliceren. Essentieel voor het denormaliseren van gegevens voordat ze in analytische opslag worden geladen.
Hoofdstuk 4VerbergenVerberg detailsBekijk detailsDatabaseconnectiviteit en SQL-integratie
Databaseconnectiviteit en SQL-integratie
Les 1 • Werken met NoSQL-databases
Maak verbinding met document- en key-value stores, voer CRUD-bewerkingen uit en mapt resultaten naar Python-objecten. Breidt pijplijnconnectiviteit uit naar niet-relationele systemen.
Les 2 • Relationele databases met SQLAlchemy
Breng verbindingen tot stand, reflecteer schema's en voer ruwe SQL uit met de core API van SQLAlchemy. Biedt een database-onafhankelijke toegangslaag voor pijplijncode.
Les 3 • Connection Pooling en best practices
Configureer verbindingspools, beheer inloggegevens veilig en vermijd veelvoorkomende anti-patronen. Zorgt voor productieklare betrouwbaarheid en beveiliging in database-toegangscode.
Les 4 • Gegevens schrijven en upserten
Voeg records programmatisch in, werk ze bij of upsert ze met SQLAlchemy en Pandas to_sql. Behandelt het schrijfpad dat nodig is voor het laden van pijplijnuitvoer in databases.
Hoofdstuk 5VerbergenVerberg detailsBekijk detailsETL-pijplijnen bouwen in Python
ETL-pijplijnen bouwen in Python
Les 1 • Pijplijnlogging en observeerbaarheid
Instrumenteer pijplijnen met gestructureerde logging, metrieken en waarschuwingen voor operationele monitoring. Transformeert scripts in observeerbare, productieklare processen.
Les 2 • Transformatielogica en bedrijfsregels
Implementeer veldtoewijzingen, afgeleide kolommen en validatieregels als pure Python-functies. Bevat bedrijfslogica in testbare, herbruikbare transformatie-eenheden.
Les 3 • Gegevens laden naar doelsystemen
Schrijf getransformeerde gegevens naar databases, datawarehouses en objectopslag met Python-connectoren. Voltooit de pijplijn door schone gegevens naar de bestemming te leveren.
Les 4 • ETL-architectuur en ontwerppatronen
Begrijp pijplijnfasen, gegevensstroom en veelvoorkomende ontwerppatronen zoals ELT en medaillonarchitectuur. Bepaalt het conceptuele kader voor al het implementatiewerk van pijplijnen.
Les 5 • Gegevens extraheren uit API's
Haal gegevens op uit REST API's met de requests-bibliotheek, verwerk paginering en beheer snelheidslimieten. Dit behandelt de meest voorkomende moderne gegevensbron voor opnamepijplijnen.
Hoofdstuk 6VerbergenVerberg detailsBekijk detailsWerken met cloudopslag en -services
Werken met cloudopslag en -services
Les 1 • Infrastructure as Code voor gegevenspijplijnen
Definieer cloudresources programmatisch met Python-gebaseerde IaC-tools om de omgevingsinrichting te automatiseren. Vermindert handmatige provisioning en zorgt voor reproduceerbare pijplijninfrastructuur.
Les 2 • Event-gedreven opname met berichtenwachtrijen
Produceer en consumeer berichten van wachtrijen en streaming-onderwerpen om pijplijnuitvoering te activeren. Verbindt Python-pijplijnen met event-gedreven en realtime gegevensarchitecturen.
Les 3 • Werken met beheerde datawarehouses
Maak verbinding met clouddatawarehouses via Python-connectoren, voer query's uit en laad gegevens efficiënt. Maakt het mogelijk voor Python-pijplijnen om analytische werkbelastingen op schaal te bedienen.
Les 4 • Cloudobjectopslag met Python SDK's
Upload, download, maak een lijst van en verwijder objecten in cloudopslagbuckets met provider SDK's. Objectopslag is de primaire landingszone voor ruwe gegevens in cloudpijplijnen.
Hoofdstuk 7VerbergenVerberg detailsBekijk detailsPijplijnorkestratie en planning
Pijplijnorkestratie en planning
Les 1 • Foutafhandeling en herhaalstrategieën
Configureer herhalingen, time-outs en SLA-waarschuwingen om georkestreerde pijplijnen veerkrachtig te maken tegen tijdelijke fouten. Vermindert direct handmatig ingrijpen in productieomgevingen.
Les 2 • Dynamische DAG's en parametrisering
Genereer DAG's programmatisch en geef runtime-parameters door aan taken voor flexibele pijplijnuitvoering. Maakt schaalbare orkestratie van veel vergelijkbare pijplijnvarianten mogelijk.
Les 3 • Orkestratieconcepten en tool-landschap
Begrijp DAG's, taakafhankelijkheden en de rol van orkestrators in data engineering. Biedt de conceptuele basis voordat orkestratiecode wordt geïmplementeerd.
Les 4 • DAG's bouwen met Apache Airflow
Definieer DAG's, operators en taakafhankelijkheden in Airflow met Python om pijplijnuitvoeringen te plannen. Airflow is de meest gebruikte orkestrator in data engineering.
Les 5 • Monitoring en waarschuwingen in orkestratie
Gebruik orkestrator UI's, logs en externe waarschuwingsintegraties om de pijplijnstatus bij te houden. Sluit de observeerbaarheidslus voor end-to-end pijplijnoperaties.
Hoofdstuk 8VerbergenVerberg detailsBekijk detailsPrestaties, testen en productie-gereedheid
Prestaties, testen en productie-gereedheid
Les 1 • Codekwaliteit en verpakking
Dwing stijl af met linters, type-check met mypy en verpak pijplijncode als installeerbare Python-modules. Verhoogt de onderhoudbaarheid van code naar professionele software-engineeringnormen.
Les 2 • Unit- en integratietests voor pijplijnen
Schrijf pytest-gebaseerde unit-tests voor transformatiefuncties en integratietests voor database-interacties. Testen voorkomt regressies en valideert de juistheid van de pijplijn.
Les 3 • Parallelle en gelijktijdige verwerking
Pas multiprocessing, threading en async-patronen toe om I/O-gebonden en CPU-gebonden pijplijntaken te parallelliseren. Vermindert de end-to-end pijplijnruntime aanzienlijk.
Les 4 • Python-code profileren en optimaliseren
Identificeer knelpunten met profileringstools en pas vectorisatie, chunking en caching toe om de doorvoer te verbeteren. Prestatieoptimalisatie is cruciaal voor grootschalige gegevenspijplijnen.
Les 5 • CI/CD voor implementatie van gegevenspijplijnen
Automatiseer testen, linten en implementeren van pijplijncode met CI/CD-pijplijnen die worden geactiveerd door versiebeheer-gebeurtenissen. Maakt veilige, herhaalbare productiereleases mogelijk.
Jouw geldig certificaat van voltooiing
Deze cursus is voor jou:
Junior data-analist: klaar om repetitieve dataworkflows te automatiseren met Python.
SQL-ontwikkelaar: wil vaardigheden uitbreiden naar programmatische pipeline-constructie.
Softwareontwikkelaar: overstappen naar data-engineering vanuit een algemene programmeerachtergrond.
Business intelligence engineer: op zoek om de volledige datapijplijn van begin tot eind te beheren.
Recent afgestudeerde informaticus: op zoek naar praktische, direct toepasbare ervaring in data-engineering.
Zelfgeleerde programmeur: gepassioneerd over data en gericht op een engineeringsrol.
Wat onze studenten zeggen
Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...

Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.

Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!

Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.

Belangrijkste opleidingen
FAQ
Wie is Dedika?
Is het certificaat geldig in Nederland?
Zijn de cursussen gratis?
Wat is de studielast van de cursus?
Hoe zien de cursussen eruit?
Hoe werken de cursussen?
Wat is de duur van de cursussen?
Wat zijn de kosten of prijzen van de cursussen?
Wat is een EAD- of online cursus en hoe werkt het?
PDF-cursus




















