Välj ditt språk
Python-kurs för Data Engineers
Över 2 miljoner studenter världen över

Python-kurs för Data Engineers

Bemästra de Python-färdigheter som dataingenjörer använder dagligen – från att bygga ETL-pipelines och ansluta till databaser till att orkestrera arbetsflöden och driftsätta produktionsfärdig kod. Den här kursen tar dig från Pythons grunder till avancerade datatekniska mönster som används i stor skala.

Dedika för företag

Vad du kommer att lära dig:

Du kommer att lära dig att skriva Python-skript som hämtar data från API:er, filer och databaser, för att sedan transformera och ladda in det i relationsdatabaser, datalager och molnlagring. Du kommer att arbeta med Pandas för datamanipulation, SQLAlchemy för databasanslutning och Apache Airflow för pipeline-orkestrering. Kursen täcker validering av datakvalitet, prestandaoptimering, parallell bearbetning och CI/CD-metoder för driftsättning av pipelines. Du kommer också att utforska PySpark för distribuerad bearbetning, Kafka för strömmande pipelines och bästa säkerhetsrutiner för att skydda känslig data i produktionsmiljöer.

Hur du studerar praktiskt Python-kurs för Data Engineers

Hur du övar Python-kurs för Data Engineers

För dig som är företag och vill utbilda ditt team

På Dedika för företag anpassas kursen med övningar och exempel från just din verksamhet, på det sätt som ditt företag behöver.

Klicka här

Kursinnehåll

8 Kapitlen • 37 LektionerVaraktighet mellan 4 och 360 timmar (du bestämmer)

Kapitel 1Se detaljer

Python-grunder för dataingenjörer

  • Lektion 1 • Kontrollflöde och iteration

    Tillämpa villkor, loopar och comprehensions för att bearbeta sekvenser av dataposter. Mappar direkt till logik för radnivåtransformationer som används i ETL-pipelines.

  • Lektion 2 • Funktioner och felhantering

    Definiera återanvändbara funktioner med argument, standardvärden och returvärden, och hantera sedan undantag elegant. Möjliggör modulär, feltolerant pipelinekod.

  • Lektion 3 • Grundläggande Python-syntax och datatyper

    Täck variabler, operatorer och inbyggda typer inklusive strängar, heltal, flyttal och booleaner. Ger den syntaktiska grunden för att skriva all logik i en datapipeline.

  • Lektion 4 • Samlingar: listor, tupler, dicts, sets

    Utforska föränderliga och oföränderliga samlingstyper och deras prestandaavvägningar. Dessa strukturer ligger till grund för datamanipulation i minnet genom hela kursen.

  • Lektion 5 • Konfigurera Python-miljön

    Installera Python, konfigurera virtuella miljöer och välj en IDE som passar dataarbete. Etablerar den reproducerbara arbetsyta som alla efterföljande kapitel är beroende av.

Kapitel 2Se detaljer

Fil-I/O och dataserialisering

  • Lektion 1 • Binära format: Parquet och Avro

    Läs och skriv kolumnorienterade Parquet- och radbaserade Avro-filer med Python-bibliotek. Dessa format är standard i moderna datasjöarkitekturer.

  • Lektion 2 • Arbeta med text- och CSV-filer

    Öppna, läs och skriv textfiler med context managers, och parsa sedan CSV med standardbiblioteket. Täcker det vanligaste rådataformatet i batch-pipelines.

  • Lektion 3 • Filsystem- och sökvägsoperationer

    Navigera i kataloger, globba filer och hantera sökvägar med modulerna pathlib och os. Automatiserar filupptäcktssteg som är vanliga i arbetsflöden för batchinläsning.

  • Lektion 4 • JSON- och XML-dataformat

    Parsa och serialisera JSON-payloads och navigera i XML-träd för API- och konfigurationsfilshantering. Ansluter till verklig inläsning av REST API-svar.

Kapitel 3Se detaljer

Datamanipulation med Pandas

  • Lektion 1 • Grunderna i DataFrames och Series

    Skapa DataFrames från dicts, CSV och JSON, och inspektera sedan struktur och datatyper. Utgör grunden för allt Pandas-baserat transformationsarbete.

  • Lektion 2 • Filtrering, sortering och urval

    Tillämpa booleska masker, loc/iloc-väljare och sorteringsoperationer för att isolera relevanta datamängder. Stöder direkt filtrering av datakvalitet i pipelinestadier.

  • Lektion 3 • Aggregering, gruppering och pivotering

    Sammanfatta data med groupby-, agg- och pivot-operationer för att producera analytiska utdata. Möjliggör mätvärdesberäkning och rapportering inom pipelinearbetsflöden.

  • Lektion 4 • Datarengöring och typkonvertering

    Hantera saknade värden, dubbletter och felaktiga typer för att producera rena, konsekventa dataset. Rengöring är det mest tidskrävande steget i verkliga datapipelines.

  • Lektion 5 • Sammanfoga och joina DataFrames

    Kombinera dataset med merge, join och concat för att replikera SQL-liknande relationslogik. Nödvändigt för att denormalisera data före inladdning i analytiska lager.

Kapitel 4Se detaljer

Databasanslutning och SQL-integration

  • Lektion 1 • Arbeta med NoSQL-databaser

    Anslut till dokument- och nyckel-/värdedatalager, utför CRUD-operationer och mappa resultat till Python-objekt. Utökar pipelineanslutningen bortom relationssystem.

  • Lektion 2 • Relationsdatabaser med SQLAlchemy

    Etablera anslutningar, reflektera scheman och kör rå SQL med SQLAlchemys core API. Ger ett databasoberoende åtkomstlager för pipelinekod.

  • Lektion 3 • Anslutningspoolning och bästa praxis

    Konfigurera anslutningspooler, hantera autentiseringsuppgifter säkert och undvik vanliga antimönster. Säkerställer produktionsmässig tillförlitlighet och säkerhet i databasåtkomstkoden.

  • Lektion 4 • Skriva och upserta data

    Infoga, uppdatera och upserta poster programmatiskt med SQLAlchemy och Pandas to_sql. Täcker skrivvägen som krävs för att ladda pipelineutdata i databaser.

Kapitel 5Se detaljer

Bygga ETL-pipelines i Python

  • Lektion 1 • Pipelogging och observerbarhet

    Instrumentera pipelines med strukturerad loggning, mätvärden och larm för att möjliggöra driftövervakning. Omvandlar skript till observerbara, produktionsklara processer.

  • Lektion 2 • Transformationslogik och affärsregler

    Implementera fältmappningar, härledda kolumner och valideringsregler som rena Python-funktioner. Kapslar in affärslogik i testbara, återanvändbara transformationsenheter.

  • Lektion 3 • Ladda data till målsystem

    Skriv transformerad data till databaser, datalager och objektlagring med Python-anslutningar. Kompletterar pipelinen genom att leverera ren data till dess destination.

  • Lektion 4 • ETL-arkitektur och designmönster

    Förstå pipelinestadier, dataflöde och vanliga designmönster som ELT och medallion-arkitektur. Sätter den konceptuella ramen för allt pipelineimplementeringsarbete.

  • Lektion 5 • Extrahera data från API:er

    Hämta data från REST API:er med requests-biblioteket, hantera paginering och hantera hastighetsbegränsningar. Täcker den vanligaste moderna datakällan för inläsningspipelines.

Kapitel 6Se detaljer

Arbeta med molnlagring och molntjänster

  • Lektion 1 • Infrastruktur som kod för datapipelines

    Definiera molnresurser programmatiskt med Python-baserade IaC-verktyg för att automatisera miljöinstallation. Minskar manuell provisionering och säkerställer reproducerbar pipelineinfrastruktur.

  • Lektion 2 • Händelsedriven inläsning med meddelandeköer

    Producera och konsumera meddelanden från köer och strömmande ämnen för att utlösa pipelinekörning. Ansluter Python-pipelines till händelsedrivna dataarkitekturer och realtidsarkitekturer.

  • Lektion 3 • Interagera med hanterade datalager

    Anslut till molndatalager via Python-anslutningar, kör frågor och ladda data effektivt. Gör att Python-pipelines kan betjäna analytiska arbetsbelastningar i stor skala.

  • Lektion 4 • Molnobjektlagring med Python SDK:er

    Ladda upp, ladda ner, lista och ta bort objekt i molnlagringshinkar med leverantörs-SDK:er. Objektlagring är den primära landningszonen för rådata i molnpipelines.

Kapitel 7Se detaljer

Pipelineorkestrering och schemaläggning

  • Lektion 1 • Felhantering och omförsöksstrategier

    Konfigurera omförsök, tidsgränser och SLA-larm för att göra orkestrerade pipelines motståndskraftiga mot tillfälliga fel. Minskar direkt manuella ingrepp i produktionsmiljöer.

  • Lektion 2 • Dynamiska DAG:ar och parameterisering

    Generera DAG:ar programmatiskt och skicka runtime-parametrar till uppgifter för flexibel pipelinekörning. Möjliggör skalbar orkestrering av många liknande pipelinevarianter.

  • Lektion 3 • Orkestreringskoncept och verktygslandskap

    Förstå DAG:ar, uppgiftsberoenden och orkestratorers roll inom dataingenjörskonst. Ger den konceptuella grunden innan orkestreringskod implementeras.

  • Lektion 4 • Bygga DAG:ar med Apache Airflow

    Definiera DAG:ar, operatorer och uppgiftsberoenden i Airflow med Python för att schemalägga pipelinekörningar. Airflow är den mest använda orkestratorn inom dataingenjörskonst.

  • Lektion 5 • Övervakning och larmning inom orkestrering

    Använd orkestratorgränssnitt, loggar och externa larmintegrationer för att spåra pipelinehälsa. Sluter observerbarhetsloopen för kompletta pipelineoperationer från början till slut.

Kapitel 8Se detaljer

Prestanda, testning och produktionsberedskap

  • Lektion 1 • Kodkvalitet och paketering

    Framtvinga stil med linters, typkontrollera med mypy och paketera pipelinekod som installeringsbara Python-moduler. Höjer kodunderhållbarheten till professionell programvaruutvecklingsstandard.

  • Lektion 2 • Enhets- och integrationstestning för pipelines

    Skriv pytest-baserade enhetstester för transformationsfunktioner och integrationstester för databasinteraktioner. Testning förhindrar regressioner och validerar pipelinekorrekthet.

  • Lektion 3 • Parallell och samtidig bearbetning

    Tillämpa multiprocessing-, threading- och async-mönster för att parallellisera I/O-bundna och CPU-bundna pipelineuppgifter. Minskar den totala pipelinekörningstiden avsevärt.

  • Lektion 4 • Genomströmning

    Identifiera flaskhalsar med profileringsverktyg och tillämpa vektorisering, chunking och cachning för att förbättra genomströmning. Prestandaoptimering är avgörande för storskaliga datapipelines.

  • Lektion 5 • CI/CD för driftsättning av datapipelines

    Automatisera testning, lintning och driftsättning av pipelinekod med CI/CD-pipelines som utlöses av versionshanteringshändelser. Möjliggör säkra, repeterbara produktionsreleaser.

Certifiering

Ditt giltiga slutförandecertifikat

Den här kursen är för dig:

  • Junior Data Analyst: redo att automatisera repetitiva dataarbetsflöden med Python.

  • SQL-utvecklare: som vill utöka sina färdigheter till programmatisk pipeline-konstruktion.

  • Mjukvaruutvecklare: som byter inriktning mot data engineering från en bredare programmeringsbakgrund.

  • Business Intelligence-ingenjör: som vill äga hela datapipelinen från början till slut.

  • Nyutexaminerad datavetare: som söker praktisk, arbetsredo erfarenhet inom data engineering.

  • Självlärd programmerare: med passion för data och som siktar på en ingenjörsroll.

Vad våra elever säger

Era lektioner är perfekta. Jag köpte årspaketet och har äntligen möjlighet att följa olika ämnen som intresserar mig utan att behöva byta plattform... tack för allt ni gör, jag har redan rekommenderat er till andra...
Giulio Carlo
Giulio CarloStudent inom Digital marknadsföring
Jag gillar hur lektionerna går rakt på sak och hur jag kan byta kapitel och hoppa över innehåll som jag inte behöver.
Mariana Ferres
Mariana FerresStudent inom Fotografi
Jag gillar innehållet och presentationssättet samt transkriptionen av videorna, vilket påskyndar processen!
Luciana Alvarenga
Luciana AlvarengaStudent inom Nageldesign
Plattformen är snabb och enkel att använda. Mångfalden av innehåll och de kompletterande videorna hjälper mycket i inlärningen.
André Felipe
André FelipeStudent inom Prompt Engineering

Viktigaste kompetenserna

FAQ

Vem är Dedika?

Är intyget giltigt i Sverige?

Är kurserna gratis?

Vad är kursens arbetsinsats?

Hur ser kurserna ut?

Hur fungerar kurserna?

Hur lång tid tar kurserna?

Vad kostar kurserna?

Vad är en EAD- eller onlinekurs och hur fungerar den?

PDF-kurs