
Python-kurs för Data Engineers
Bemästra de Python-färdigheter som dataingenjörer använder dagligen – från att bygga ETL-pipelines och ansluta till databaser till att orkestrera arbetsflöden och driftsätta produktionsfärdig kod. Den här kursen tar dig från Pythons grunder till avancerade datatekniska mönster som används i stor skala.
Vad du kommer att lära dig:
Du kommer att lära dig att skriva Python-skript som hämtar data från API:er, filer och databaser, för att sedan transformera och ladda in det i relationsdatabaser, datalager och molnlagring. Du kommer att arbeta med Pandas för datamanipulation, SQLAlchemy för databasanslutning och Apache Airflow för pipeline-orkestrering. Kursen täcker validering av datakvalitet, prestandaoptimering, parallell bearbetning och CI/CD-metoder för driftsättning av pipelines. Du kommer också att utforska PySpark för distribuerad bearbetning, Kafka för strömmande pipelines och bästa säkerhetsrutiner för att skydda känslig data i produktionsmiljöer.
Hur du studerar praktiskt Python-kurs för Data Engineers
Hur du övar Python-kurs för Data Engineers
För dig som är företag och vill utbilda ditt team
På Dedika för företag anpassas kursen med övningar och exempel från just din verksamhet, på det sätt som ditt företag behöver.
Kursinnehåll
8 Kapitlen • 37 LektionerVaraktighet mellan 4 och 360 timmar (du bestämmer)
Kapitel 1DöljDölj detaljerSe detaljerPython-grunder för dataingenjörer
Python-grunder för dataingenjörer
Lektion 1 • Kontrollflöde och iteration
Tillämpa villkor, loopar och comprehensions för att bearbeta sekvenser av dataposter. Mappar direkt till logik för radnivåtransformationer som används i ETL-pipelines.
Lektion 2 • Funktioner och felhantering
Definiera återanvändbara funktioner med argument, standardvärden och returvärden, och hantera sedan undantag elegant. Möjliggör modulär, feltolerant pipelinekod.
Lektion 3 • Grundläggande Python-syntax och datatyper
Täck variabler, operatorer och inbyggda typer inklusive strängar, heltal, flyttal och booleaner. Ger den syntaktiska grunden för att skriva all logik i en datapipeline.
Lektion 4 • Samlingar: listor, tupler, dicts, sets
Utforska föränderliga och oföränderliga samlingstyper och deras prestandaavvägningar. Dessa strukturer ligger till grund för datamanipulation i minnet genom hela kursen.
Lektion 5 • Konfigurera Python-miljön
Installera Python, konfigurera virtuella miljöer och välj en IDE som passar dataarbete. Etablerar den reproducerbara arbetsyta som alla efterföljande kapitel är beroende av.
Kapitel 2DöljDölj detaljerSe detaljerFil-I/O och dataserialisering
Fil-I/O och dataserialisering
Lektion 1 • Binära format: Parquet och Avro
Läs och skriv kolumnorienterade Parquet- och radbaserade Avro-filer med Python-bibliotek. Dessa format är standard i moderna datasjöarkitekturer.
Lektion 2 • Arbeta med text- och CSV-filer
Öppna, läs och skriv textfiler med context managers, och parsa sedan CSV med standardbiblioteket. Täcker det vanligaste rådataformatet i batch-pipelines.
Lektion 3 • Filsystem- och sökvägsoperationer
Navigera i kataloger, globba filer och hantera sökvägar med modulerna pathlib och os. Automatiserar filupptäcktssteg som är vanliga i arbetsflöden för batchinläsning.
Lektion 4 • JSON- och XML-dataformat
Parsa och serialisera JSON-payloads och navigera i XML-träd för API- och konfigurationsfilshantering. Ansluter till verklig inläsning av REST API-svar.
Kapitel 3DöljDölj detaljerSe detaljerDatamanipulation med Pandas
Datamanipulation med Pandas
Lektion 1 • Grunderna i DataFrames och Series
Skapa DataFrames från dicts, CSV och JSON, och inspektera sedan struktur och datatyper. Utgör grunden för allt Pandas-baserat transformationsarbete.
Lektion 2 • Filtrering, sortering och urval
Tillämpa booleska masker, loc/iloc-väljare och sorteringsoperationer för att isolera relevanta datamängder. Stöder direkt filtrering av datakvalitet i pipelinestadier.
Lektion 3 • Aggregering, gruppering och pivotering
Sammanfatta data med groupby-, agg- och pivot-operationer för att producera analytiska utdata. Möjliggör mätvärdesberäkning och rapportering inom pipelinearbetsflöden.
Lektion 4 • Datarengöring och typkonvertering
Hantera saknade värden, dubbletter och felaktiga typer för att producera rena, konsekventa dataset. Rengöring är det mest tidskrävande steget i verkliga datapipelines.
Lektion 5 • Sammanfoga och joina DataFrames
Kombinera dataset med merge, join och concat för att replikera SQL-liknande relationslogik. Nödvändigt för att denormalisera data före inladdning i analytiska lager.
Kapitel 4DöljDölj detaljerSe detaljerDatabasanslutning och SQL-integration
Databasanslutning och SQL-integration
Lektion 1 • Arbeta med NoSQL-databaser
Anslut till dokument- och nyckel-/värdedatalager, utför CRUD-operationer och mappa resultat till Python-objekt. Utökar pipelineanslutningen bortom relationssystem.
Lektion 2 • Relationsdatabaser med SQLAlchemy
Etablera anslutningar, reflektera scheman och kör rå SQL med SQLAlchemys core API. Ger ett databasoberoende åtkomstlager för pipelinekod.
Lektion 3 • Anslutningspoolning och bästa praxis
Konfigurera anslutningspooler, hantera autentiseringsuppgifter säkert och undvik vanliga antimönster. Säkerställer produktionsmässig tillförlitlighet och säkerhet i databasåtkomstkoden.
Lektion 4 • Skriva och upserta data
Infoga, uppdatera och upserta poster programmatiskt med SQLAlchemy och Pandas to_sql. Täcker skrivvägen som krävs för att ladda pipelineutdata i databaser.
Kapitel 5DöljDölj detaljerSe detaljerBygga ETL-pipelines i Python
Bygga ETL-pipelines i Python
Lektion 1 • Pipelogging och observerbarhet
Instrumentera pipelines med strukturerad loggning, mätvärden och larm för att möjliggöra driftövervakning. Omvandlar skript till observerbara, produktionsklara processer.
Lektion 2 • Transformationslogik och affärsregler
Implementera fältmappningar, härledda kolumner och valideringsregler som rena Python-funktioner. Kapslar in affärslogik i testbara, återanvändbara transformationsenheter.
Lektion 3 • Ladda data till målsystem
Skriv transformerad data till databaser, datalager och objektlagring med Python-anslutningar. Kompletterar pipelinen genom att leverera ren data till dess destination.
Lektion 4 • ETL-arkitektur och designmönster
Förstå pipelinestadier, dataflöde och vanliga designmönster som ELT och medallion-arkitektur. Sätter den konceptuella ramen för allt pipelineimplementeringsarbete.
Lektion 5 • Extrahera data från API:er
Hämta data från REST API:er med requests-biblioteket, hantera paginering och hantera hastighetsbegränsningar. Täcker den vanligaste moderna datakällan för inläsningspipelines.
Kapitel 6DöljDölj detaljerSe detaljerArbeta med molnlagring och molntjänster
Arbeta med molnlagring och molntjänster
Lektion 1 • Infrastruktur som kod för datapipelines
Definiera molnresurser programmatiskt med Python-baserade IaC-verktyg för att automatisera miljöinstallation. Minskar manuell provisionering och säkerställer reproducerbar pipelineinfrastruktur.
Lektion 2 • Händelsedriven inläsning med meddelandeköer
Producera och konsumera meddelanden från köer och strömmande ämnen för att utlösa pipelinekörning. Ansluter Python-pipelines till händelsedrivna dataarkitekturer och realtidsarkitekturer.
Lektion 3 • Interagera med hanterade datalager
Anslut till molndatalager via Python-anslutningar, kör frågor och ladda data effektivt. Gör att Python-pipelines kan betjäna analytiska arbetsbelastningar i stor skala.
Lektion 4 • Molnobjektlagring med Python SDK:er
Ladda upp, ladda ner, lista och ta bort objekt i molnlagringshinkar med leverantörs-SDK:er. Objektlagring är den primära landningszonen för rådata i molnpipelines.
Kapitel 7DöljDölj detaljerSe detaljerPipelineorkestrering och schemaläggning
Pipelineorkestrering och schemaläggning
Lektion 1 • Felhantering och omförsöksstrategier
Konfigurera omförsök, tidsgränser och SLA-larm för att göra orkestrerade pipelines motståndskraftiga mot tillfälliga fel. Minskar direkt manuella ingrepp i produktionsmiljöer.
Lektion 2 • Dynamiska DAG:ar och parameterisering
Generera DAG:ar programmatiskt och skicka runtime-parametrar till uppgifter för flexibel pipelinekörning. Möjliggör skalbar orkestrering av många liknande pipelinevarianter.
Lektion 3 • Orkestreringskoncept och verktygslandskap
Förstå DAG:ar, uppgiftsberoenden och orkestratorers roll inom dataingenjörskonst. Ger den konceptuella grunden innan orkestreringskod implementeras.
Lektion 4 • Bygga DAG:ar med Apache Airflow
Definiera DAG:ar, operatorer och uppgiftsberoenden i Airflow med Python för att schemalägga pipelinekörningar. Airflow är den mest använda orkestratorn inom dataingenjörskonst.
Lektion 5 • Övervakning och larmning inom orkestrering
Använd orkestratorgränssnitt, loggar och externa larmintegrationer för att spåra pipelinehälsa. Sluter observerbarhetsloopen för kompletta pipelineoperationer från början till slut.
Kapitel 8DöljDölj detaljerSe detaljerPrestanda, testning och produktionsberedskap
Prestanda, testning och produktionsberedskap
Lektion 1 • Kodkvalitet och paketering
Framtvinga stil med linters, typkontrollera med mypy och paketera pipelinekod som installeringsbara Python-moduler. Höjer kodunderhållbarheten till professionell programvaruutvecklingsstandard.
Lektion 2 • Enhets- och integrationstestning för pipelines
Skriv pytest-baserade enhetstester för transformationsfunktioner och integrationstester för databasinteraktioner. Testning förhindrar regressioner och validerar pipelinekorrekthet.
Lektion 3 • Parallell och samtidig bearbetning
Tillämpa multiprocessing-, threading- och async-mönster för att parallellisera I/O-bundna och CPU-bundna pipelineuppgifter. Minskar den totala pipelinekörningstiden avsevärt.
Lektion 4 • Genomströmning
Identifiera flaskhalsar med profileringsverktyg och tillämpa vektorisering, chunking och cachning för att förbättra genomströmning. Prestandaoptimering är avgörande för storskaliga datapipelines.
Lektion 5 • CI/CD för driftsättning av datapipelines
Automatisera testning, lintning och driftsättning av pipelinekod med CI/CD-pipelines som utlöses av versionshanteringshändelser. Möjliggör säkra, repeterbara produktionsreleaser.
Ditt giltiga slutförandecertifikat
Den här kursen är för dig:
Junior Data Analyst: redo att automatisera repetitiva dataarbetsflöden med Python.
SQL-utvecklare: som vill utöka sina färdigheter till programmatisk pipeline-konstruktion.
Mjukvaruutvecklare: som byter inriktning mot data engineering från en bredare programmeringsbakgrund.
Business Intelligence-ingenjör: som vill äga hela datapipelinen från början till slut.
Nyutexaminerad datavetare: som söker praktisk, arbetsredo erfarenhet inom data engineering.
Självlärd programmerare: med passion för data och som siktar på en ingenjörsroll.
Vad våra elever säger
Era lektioner är perfekta. Jag köpte årspaketet och har äntligen möjlighet att följa olika ämnen som intresserar mig utan att behöva byta plattform... tack för allt ni gör, jag har redan rekommenderat er till andra...

Jag gillar hur lektionerna går rakt på sak och hur jag kan byta kapitel och hoppa över innehåll som jag inte behöver.

Jag gillar innehållet och presentationssättet samt transkriptionen av videorna, vilket påskyndar processen!

Plattformen är snabb och enkel att använda. Mångfalden av innehåll och de kompletterande videorna hjälper mycket i inlärningen.

Viktigaste kompetenserna
FAQ
Vem är Dedika?
Är intyget giltigt i Sverige?
Är kurserna gratis?
Vad är kursens arbetsinsats?
Hur ser kurserna ut?
Hur fungerar kurserna?
Hur lång tid tar kurserna?
Vad kostar kurserna?
Vad är en EAD- eller onlinekurs och hur fungerar den?
PDF-kurs




















