Kies uw taal
Cursus Python Data Engineering
Meer dan 2 miljoen studenten wereldwijd

Cursus Python Data Engineering

Beheers de Python-vaardigheden die data-engineers dagelijks gebruiken — van het bouwen van ETL-pijplijnen en het verbinden met databases tot het orkestreren van workflows en het implementeren van productieklaar code. Deze cursus neemt je mee van de basisprincipes van Python tot geavanceerde data-engineeringpatronen die op schaal worden gebruikt.

Dedika voor bedrijven

Wat je gaat leren:

Je leert Python-scripts schrijven die gegevens uit API's, bestanden en databases halen, deze vervolgens transformeren en laden in relationele databases, datawarehouses en cloudopslag. Je werkt met Pandas voor gegevensmanipulatie, SQLAlchemy voor databaseconnectiviteit en Apache Airflow voor pijplijnorkestratie. De cursus behandelt gegevenskwaliteitsvalidatie, prestatieoptimalisatie, parallelle verwerking en CI/CD-praktijken voor pijplijnimplementatie. Je verkent ook PySpark voor gedistribueerde verwerking, Kafka voor streamingpijplijnen en beveiligingsbest practices voor het beschermen van gevoelige gegevens in productieomgevingen.

Hoe je praktisch studeert Cursus Python Data Engineering

Hoe je oefent Cursus Python Data Engineering

Voor bedrijven die hun team willen trainen

Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.

Klik hier

Cursusinhoud

8 Hoofdstukken • 37 LessenDuur tussen 4 en 360 uren (jij beslist)

Hoofdstuk 1Bekijk details

Python Foundations voor Data Engineers

  • Les 1 • Control Flow en Iteratie

    Pas conditionals, loops en comprehensions toe om reeksen gegevensrecords te verwerken. Dit is direct toepasbaar op de transformatielogica op rijniveau die in ETL-pipelines wordt gebruikt.

  • Les 2 • Functies en Foutafhandeling

    Definieer herbruikbare functies met argumenten, standaardwaarden en retourwaarden en handel vervolgens uitzonderingen netjes af. Maakt modulaire, fouttolerante pijplijncode mogelijk.

  • Les 3 • Kern Python-syntax en gegevenstypen

    Dek variabelen, operatoren en ingebouwde typen af, waaronder strings, integers, floats en booleans. Dit vormt de syntactische basis voor het schrijven van logica voor gegevenspijplijnen.

  • Les 4 • Collecties: Lijsten, Tuples, Dicts, Sets

    Verken veranderlijke en onveranderlijke collectietypen en hun prestatieafwegingen. Deze structuren vormen de basis voor gegevensmanipulatie in het geheugen gedurende de hele cursus.

  • Les 5 • De Python-omgeving instellen

    Installeer Python, configureer virtuele omgevingen en selecteer een IDE die geschikt is voor datawerk. Dit creëert de reproduceerbare werkruimte waar alle volgende hoofdstukken van afhankelijk zijn.

Hoofdstuk 2Bekijk details

Bestands I/O en gegevensserialisatie

  • Les 1 • Binaire formaten: Parquet en Avro

    Lees en schrijf kolomgeoriënteerde Parquet- en rijgebaseerde Avro-bestanden met Python-bibliotheken. Deze formaten zijn standaard in moderne data lake-architecturen.

  • Les 2 • Werken met tekst- en CSV-bestanden

    Open, lees en schrijf tekstbestanden met contextmanagers en parseer vervolgens CSV met de standaardbibliotheek. Dit behandelt het meest voorkomende ruwe gegevensformaat in batchpijplijnen.

  • Les 3 • Bestandssysteem- en padbewerkingen

    Navigeer door mappen, gebruik glob voor bestanden en beheer paden met de modules pathlib en os. Automatiseert stappen voor het vinden van bestanden die gebruikelijk zijn in batch-opnameworkflows.

  • Les 4 • JSON- en XML-gegevensformaten

    Parseer en serialiseer JSON-payloads en navigeer door XML-bomen voor het verwerken van API's en configuratiebestanden. Dit sluit aan bij realistische opname van REST API-antwoorden.

Hoofdstuk 3Bekijk details

Gegevensmanipulatie met Pandas

  • Les 1 • DataFrames en Series basisbeginselen

    Maak DataFrames van dicts, CSV en JSON en inspecteer vervolgens de structuur en gegevenstypen. Vormt de basis voor al het op Pandas gebaseerde transformatiewerk.

  • Les 2 • Filteren, sorteren en selecteren

    Pas booleaanse masks, loc/iloc selectors en sorteerbewerkingen toe om relevante gegevenssubsets te isoleren. Ondersteunt direct het filteren van gegevenskwaliteit in pijplijnfasen.

  • Les 3 • Aggregatie, groeperen en draaien

    Vat gegevens samen met groupby, agg en pivot-bewerkingen om analytische uitvoer te produceren. Maakt berekening van metrieken en rapportage binnen pijplijnworkflows mogelijk.

  • Les 4 • Gegevens opschonen en type-coercie

    Ga om met ontbrekende waarden, duplicaten en onjuiste typen om schone, consistente datasets te produceren. Opschonen is de meest tijdrovende stap in realistische gegevenspijplijnen.

  • Les 5 • DataFrames samenvoegen en joinen

    Combineer datasets met merge, join en concat om SQL-achtige relationele logica te repliceren. Essentieel voor het denormaliseren van gegevens voordat ze in analytische opslag worden geladen.

Hoofdstuk 4Bekijk details

Databaseconnectiviteit en SQL-integratie

  • Les 1 • Werken met NoSQL-databases

    Maak verbinding met document- en key-value stores, voer CRUD-bewerkingen uit en mapt resultaten naar Python-objecten. Breidt pijplijnconnectiviteit uit naar niet-relationele systemen.

  • Les 2 • Relationele databases met SQLAlchemy

    Breng verbindingen tot stand, reflecteer schema's en voer ruwe SQL uit met de core API van SQLAlchemy. Biedt een database-onafhankelijke toegangslaag voor pijplijncode.

  • Les 3 • Connection Pooling en best practices

    Configureer verbindingspools, beheer inloggegevens veilig en vermijd veelvoorkomende anti-patronen. Zorgt voor productieklare betrouwbaarheid en beveiliging in database-toegangscode.

  • Les 4 • Gegevens schrijven en upserten

    Voeg records programmatisch in, werk ze bij of upsert ze met SQLAlchemy en Pandas to_sql. Behandelt het schrijfpad dat nodig is voor het laden van pijplijnuitvoer in databases.

Hoofdstuk 5Bekijk details

ETL-pijplijnen bouwen in Python

  • Les 1 • Pijplijnlogging en observeerbaarheid

    Instrumenteer pijplijnen met gestructureerde logging, metrieken en waarschuwingen voor operationele monitoring. Transformeert scripts in observeerbare, productieklare processen.

  • Les 2 • Transformatielogica en bedrijfsregels

    Implementeer veldtoewijzingen, afgeleide kolommen en validatieregels als pure Python-functies. Bevat bedrijfslogica in testbare, herbruikbare transformatie-eenheden.

  • Les 3 • Gegevens laden naar doelsystemen

    Schrijf getransformeerde gegevens naar databases, datawarehouses en objectopslag met Python-connectoren. Voltooit de pijplijn door schone gegevens naar de bestemming te leveren.

  • Les 4 • ETL-architectuur en ontwerppatronen

    Begrijp pijplijnfasen, gegevensstroom en veelvoorkomende ontwerppatronen zoals ELT en medaillonarchitectuur. Bepaalt het conceptuele kader voor al het implementatiewerk van pijplijnen.

  • Les 5 • Gegevens extraheren uit API's

    Haal gegevens op uit REST API's met de requests-bibliotheek, verwerk paginering en beheer snelheidslimieten. Dit behandelt de meest voorkomende moderne gegevensbron voor opnamepijplijnen.

Hoofdstuk 6Bekijk details

Werken met cloudopslag en -services

  • Les 1 • Infrastructure as Code voor gegevenspijplijnen

    Definieer cloudresources programmatisch met Python-gebaseerde IaC-tools om de omgevingsinrichting te automatiseren. Vermindert handmatige provisioning en zorgt voor reproduceerbare pijplijninfrastructuur.

  • Les 2 • Event-gedreven opname met berichtenwachtrijen

    Produceer en consumeer berichten van wachtrijen en streaming-onderwerpen om pijplijnuitvoering te activeren. Verbindt Python-pijplijnen met event-gedreven en realtime gegevensarchitecturen.

  • Les 3 • Werken met beheerde datawarehouses

    Maak verbinding met clouddatawarehouses via Python-connectoren, voer query's uit en laad gegevens efficiënt. Maakt het mogelijk voor Python-pijplijnen om analytische werkbelastingen op schaal te bedienen.

  • Les 4 • Cloudobjectopslag met Python SDK's

    Upload, download, maak een lijst van en verwijder objecten in cloudopslagbuckets met provider SDK's. Objectopslag is de primaire landingszone voor ruwe gegevens in cloudpijplijnen.

Hoofdstuk 7Bekijk details

Pijplijnorkestratie en planning

  • Les 1 • Foutafhandeling en herhaalstrategieën

    Configureer herhalingen, time-outs en SLA-waarschuwingen om georkestreerde pijplijnen veerkrachtig te maken tegen tijdelijke fouten. Vermindert direct handmatig ingrijpen in productieomgevingen.

  • Les 2 • Dynamische DAG's en parametrisering

    Genereer DAG's programmatisch en geef runtime-parameters door aan taken voor flexibele pijplijnuitvoering. Maakt schaalbare orkestratie van veel vergelijkbare pijplijnvarianten mogelijk.

  • Les 3 • Orkestratieconcepten en tool-landschap

    Begrijp DAG's, taakafhankelijkheden en de rol van orkestrators in data engineering. Biedt de conceptuele basis voordat orkestratiecode wordt geïmplementeerd.

  • Les 4 • DAG's bouwen met Apache Airflow

    Definieer DAG's, operators en taakafhankelijkheden in Airflow met Python om pijplijnuitvoeringen te plannen. Airflow is de meest gebruikte orkestrator in data engineering.

  • Les 5 • Monitoring en waarschuwingen in orkestratie

    Gebruik orkestrator UI's, logs en externe waarschuwingsintegraties om de pijplijnstatus bij te houden. Sluit de observeerbaarheidslus voor end-to-end pijplijnoperaties.

Hoofdstuk 8Bekijk details

Prestaties, testen en productie-gereedheid

  • Les 1 • Codekwaliteit en verpakking

    Dwing stijl af met linters, type-check met mypy en verpak pijplijncode als installeerbare Python-modules. Verhoogt de onderhoudbaarheid van code naar professionele software-engineeringnormen.

  • Les 2 • Unit- en integratietests voor pijplijnen

    Schrijf pytest-gebaseerde unit-tests voor transformatiefuncties en integratietests voor database-interacties. Testen voorkomt regressies en valideert de juistheid van de pijplijn.

  • Les 3 • Parallelle en gelijktijdige verwerking

    Pas multiprocessing, threading en async-patronen toe om I/O-gebonden en CPU-gebonden pijplijntaken te parallelliseren. Vermindert de end-to-end pijplijnruntime aanzienlijk.

  • Les 4 • Python-code profileren en optimaliseren

    Identificeer knelpunten met profileringstools en pas vectorisatie, chunking en caching toe om de doorvoer te verbeteren. Prestatieoptimalisatie is cruciaal voor grootschalige gegevenspijplijnen.

  • Les 5 • CI/CD voor implementatie van gegevenspijplijnen

    Automatiseer testen, linten en implementeren van pijplijncode met CI/CD-pijplijnen die worden geactiveerd door versiebeheer-gebeurtenissen. Maakt veilige, herhaalbare productiereleases mogelijk.

Certificering

Jouw geldig certificaat van voltooiing

Deze cursus is voor jou:

  • Junior data-analist: klaar om repetitieve dataworkflows te automatiseren met Python.

  • SQL-ontwikkelaar: wil vaardigheden uitbreiden naar programmatische pipeline-constructie.

  • Softwareontwikkelaar: overstappen naar data-engineering vanuit een algemene programmeerachtergrond.

  • Business intelligence engineer: op zoek om de volledige datapijplijn van begin tot eind te beheren.

  • Recent afgestudeerde informaticus: op zoek naar praktische, direct toepasbare ervaring in data-engineering.

  • Zelfgeleerde programmeur: gepassioneerd over data en gericht op een engineeringsrol.

Wat onze studenten zeggen

Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...
Giulio Carlo
Giulio CarloStudent Digitale Marketing
Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.
Mariana Ferres
Mariana FerresStudent Fotografie
Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!
Luciana Alvarenga
Luciana AlvarengaStudent Nageldesign
Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.
André Felipe
André FelipeStudent Prompt Engineering

Belangrijkste opleidingen

FAQ

Wie is Dedika?

Is het certificaat geldig in Nederland?

Zijn de cursussen gratis?

Wat is de studielast van de cursus?

Hoe zien de cursussen eruit?

Hoe werken de cursussen?

Wat is de duur van de cursussen?

Wat zijn de kosten of prijzen van de cursussen?

Wat is een EAD- of online cursus en hoe werkt het?

PDF-cursus