
Python Data Engineering Kurs
Meistern Sie die Python-Fähigkeiten, die Data Engineers täglich einsetzen – vom Erstellen von ETL-Pipelines und der Verbindung zu Datenbanken über das Orchestrieren von Workflows bis hin zum Deployment von produktionsreifem Code. Dieser Kurs führt Sie von den Python-Grundlagen hin zu fortgeschrittenen Data-Engineering-Mustern, die in großem Maßstab eingesetzt werden.
Was Sie lernen werden:
Sie lernen, Python-Skripte zu schreiben, die Daten aus APIs, Dateien und Datenbanken extrahieren und diese dann transformieren und in relationale Datenbanken, Data Warehouses und Cloud-Speicher laden. Sie arbeiten mit Pandas zur Datenmanipulation, SQLAlchemy für Datenbankkonnektivität und Apache Airflow zur Pipeline-Orchestrierung. Der Kurs behandelt die Validierung der Datenqualität, Leistungsoptimierung, parallele Verarbeitung und CI/CD-Praktiken für das Pipeline-Deployment. Sie untersuchen auch PySpark für die verteilte Verarbeitung, Kafka für Streaming-Pipelines und Sicherheits-Best-Practices zum Schutz sensibler Daten in Produktionsumgebungen.
Wie Sie praxisnah lernen Python Data Engineering Kurs
Wie Sie üben Python Data Engineering Kurs
Für Unternehmen, die ihr Team schulen möchten
Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.
Kursinhalt
8 Kapitel • 37 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)
Kapitel 1AusblendenDetails ausblendenDetails anzeigenPython-Grundlagen für Dateningenieure
Python-Grundlagen für Dateningenieure
Lektion 1 • Ablaufsteuerung und Iteration
Wenden Sie Bedingungen, Schleifen und Comprehensions an, um Sequenzen von Datensätzen zu verarbeiten. Dies wird direkt auf die zeilenbasierte Transformationslogik in ETL-Pipelines abgebildet.
Lektion 2 • Funktionen und Fehlerbehandlung
Definieren Sie wiederverwendbare Funktionen mit Argumenten, Standardwerten und Rückgabewerten und behandeln Sie dann Ausnahmen ordnungsgemäß. Ermöglicht modularen, fehlertoleranten Pipeline-Code.
Lektion 3 • Kern-Python-Syntax und Datentypen
Behandeln Sie Variablen, Operatoren und eingebaute Typen wie Zeichenketten, Ganzzahlen, Gleitkommazahlen und boolesche Werte. Bietet die syntaktische Grundlage für das Schreiben jeglicher Datenpipeline-Logik.
Lektion 4 • Sammlungen: Listen, Tupel, Dicts, Sets
Erkunden Sie veränderbare und unveränderbare Sammlungstypen und ihre Leistungskompromisse. Diese Strukturen untermauern die gesamte In-Memory-Datenmanipulation im Kurs.
Lektion 5 • Einrichten der Python-Umgebung
Installieren Sie Python, konfigurieren Sie virtuelle Umgebungen und wählen Sie eine für die Datenarbeit geeignete IDE aus. Etabliert den reproduzierbaren Arbeitsbereich, von dem alle nachfolgenden Kapitel abhängen.
Kapitel 2AusblendenDetails ausblendenDetails anzeigenDatei-E/A und Datenserialisierung
Datei-E/A und Datenserialisierung
Lektion 1 • Binärformate: Parquet und Avro
Lesen und schreiben Sie spaltenorientierte Parquet- und zeilenbasierte Avro-Dateien mit Python-Bibliotheken. Diese Formate sind Standard in modernen Data-Lake-Architekturen.
Lektion 2 • Arbeiten mit Text- und CSV-Dateien
Öffnen, lesen und schreiben Sie Textdateien mit Kontextmanagern und parsen Sie dann CSV mit der Standardbibliothek. Behandelt das häufigste Rohdatenformat in Batch-Pipelines.
Lektion 3 • Dateisystem- und Pfadoperationen
Navigieren Sie in Verzeichnissen, suchen Sie Dateien mit Glob-Mustern und verwalten Sie Pfade mit den Modulen pathlib und os. Automatisiert Dateisuchschritte, die in Batch-Aufnahme-Workflows üblich sind.
Lektion 4 • JSON- und XML-Datenformate
Parsen und serialisieren Sie JSON-Nutzdaten und navigieren Sie durch XML-Bäume für die API- und Konfigurationsdateiverarbeitung. Verbindet sich mit der realen Aufnahme von REST-API-Antworten.
Kapitel 3AusblendenDetails ausblendenDetails anzeigenDatenmanipulation mit Pandas
Datenmanipulation mit Pandas
Lektion 1 • DataFrames und Series Grundlagen
Erstellen Sie DataFrames aus dicts, CSV und JSON und überprüfen Sie dann Struktur und Datentypen. Bildet die Grundlage für alle Pandas-basierten Transformationsarbeiten.
Lektion 2 • Filtern, Sortieren und Auswählen
Wenden Sie boolesche Masken, loc/iloc-Selektoren und Sortieroperationen an, um relevante Datenteilmengen zu isolieren. Unterstützt direkt die Datenqualitätsfilterung in Pipeline-Phasen.
Lektion 3 • Aggregation, Gruppierung und Pivotierung
Fassen Sie Daten mit groupby-, agg- und Pivot-Operationen zusammen, um analytische Ausgaben zu erzeugen. Ermöglicht die Berechnung von Metriken und die Berichterstellung innerhalb von Pipeline-Workflows.
Lektion 4 • Datenbereinigung und Typkonvertierung
Behandeln Sie fehlende Werte, Duplikate und falsche Typen, um bereinigte, konsistente Datensätze zu erzeugen. Die Bereinigung ist der zeitaufwändigste Schritt in realen Datenpipelines.
Lektion 5 • Zusammenführen und Verbinden von DataFrames
Kombinieren Sie Datensätze mit merge, join und concat, um SQL-ähnliche relationale Logik nachzubilden. Unerlässlich für die Denormalisierung von Daten vor dem Laden in analytische Speicher.
Kapitel 4AusblendenDetails ausblendenDetails anzeigenDatenbankanbindung und SQL-Integration
Datenbankanbindung und SQL-Integration
Lektion 1 • Arbeiten mit NoSQL-Datenbanken
Verbinden Sie sich mit Dokument- und Schlüssel-Wert-Speichern, führen Sie CRUD-Operationen durch und ordnen Sie Ergebnisse Python-Objekten zu. Erweitert die Pipeline-Konnektivität über relationale Systeme hinaus.
Lektion 2 • Relationale Datenbanken mit SQLAlchemy
Stellen Sie Verbindungen her, spiegeln Sie Schemas und führen Sie rohes SQL mit der Core-API von SQLAlchemy aus. Bietet eine datenbankunabhängige Zugriffsschicht für Pipeline-Code.
Lektion 3 • Verbindungspooling und Best Practices
Konfigurieren Sie Verbindungspools, verwalten Sie Anmeldedaten sicher und vermeiden Sie gängige Anti-Patterns. Gewährleistet Zuverlässigkeit und Sicherheit auf Produktionsniveau im Datenbankzugriffscode.
Lektion 4 • Schreiben und Upserting von Daten
Fügen Sie Datensätze programmatisch mit SQLAlchemy und Pandas to_sql ein, aktualisieren Sie sie und führen Sie Upserts durch. Behandelt den Schreibpfad, der zum Laden von Pipeline-Ausgaben in Datenbanken erforderlich ist.
Kapitel 5AusblendenDetails ausblendenDetails anzeigenErstellen von ETL-Pipelines in Python
Erstellen von ETL-Pipelines in Python
Lektion 1 • Pipeline-Protokollierung und Observability
Instrumentieren Sie Pipelines mit strukturierter Protokollierung, Metriken und Alarmierung, um eine operative Überwachung zu ermöglichen. Verwandelt Skripte in beobachtbare, produktionsreife Prozesse.
Lektion 2 • Transformationslogik und Geschäftsregeln
Implementieren Sie Feldzuordnungen, abgeleitete Spalten und Validierungsregeln als reine Python-Funktionen. Kapseln Sie Geschäftslogik in testbaren, wiederverwendbaren Transformationseinheiten.
Lektion 3 • Laden von Daten in Zielsysteme
Schreiben Sie transformierte Daten mit Python-Konnektoren in Datenbanken, Data Warehouses und Objektspeicher. Schließt die Pipeline ab, indem bereinigte Daten an ihr Ziel geliefert werden.
Lektion 4 • ETL-Architektur und Entwurfsmuster
Verstehen Sie Pipeline-Phasen, Datenfluss und gängige Entwurfsmuster wie ELT und Medallion-Architektur. Legt den konzeptionellen Rahmen für alle Pipeline-Implementierungsarbeiten fest.
Lektion 5 • Extrahieren von Daten aus APIs
Rufen Sie Daten mit der requests-Bibliothek von REST-APIs ab, behandeln Sie Paginierung und verwalten Sie Ratenlimits. Behandelt die häufigste moderne Datenquelle für Aufnahmepipelines.
Kapitel 6AusblendenDetails ausblendenDetails anzeigenArbeiten mit Cloud-Speicher und -Diensten
Arbeiten mit Cloud-Speicher und -Diensten
Lektion 1 • Infrastructure as Code für Datenpipelines
Definieren Sie Cloud-Ressourcen programmatisch mit Python-basierten IaC-Tools, um die Umgebungseinrichtung zu automatisieren. Reduziert manuelle Bereitstellung und gewährleistet reproduzierbare Pipeline-Infrastruktur.
Lektion 2 • Ereignisgesteuerte Aufnahme mit Message Queues
Produzieren und konsumieren Sie Nachrichten aus Queues und Streaming-Themen, um die Pipeline-Ausführung auszulösen. Verbindet Python-Pipelines mit ereignisgesteuerten und Echtzeit-Datenarchitekturen.
Lektion 3 • Interaktion mit verwalteten Data Warehouses
Verbinden Sie sich über Python-Konnektoren mit Cloud Data Warehouses, führen Sie Abfragen aus und laden Sie Daten effizient. Ermöglicht Python-Pipelines, analytische Workloads in großem Maßstab zu bedienen.
Lektion 4 • Cloud-Objektspeicher mit Python-SDKs
Laden Sie Objekte in Cloud-Speicher-Buckets mit Provider-SDKs hoch, herunter, listen Sie sie auf und löschen Sie sie. Objektspeicher ist die primäre Landezone für Rohdaten in Cloud-Pipelines.
Kapitel 7AusblendenDetails ausblendenDetails anzeigenPipeline-Orchestrierung und -Planung
Pipeline-Orchestrierung und -Planung
Lektion 1 • Fehlerbehandlung und Wiederholungsstrategien
Konfigurieren Sie Wiederholungen, Timeouts und SLA-Alarme, um orchestrierte Pipelines widerstandsfähig gegen vorübergehende Ausfälle zu machen. Reduziert direkt manuelle Eingriffe in Produktionsumgebungen.
Lektion 2 • Dynamische DAGs und Parametrisierung
Generieren Sie DAGs programmatisch und übergeben Sie Laufzeitparameter an Aufgaben für eine flexible Pipeline-Ausführung. Ermöglicht die skalierbare Orchestrierung vieler ähnlicher Pipeline-Varianten.
Lektion 3 • Orchestrierungskonzepte und Tool-Landschaft
Verstehen Sie DAGs, Aufgabenabhängigkeiten und die Rolle von Orchestratoren in der Datentechnik. Bietet die konzeptionelle Grundlage vor der Implementierung von Orchestrierungscode.
Lektion 4 • Erstellen von DAGs mit Apache Airflow
Definieren Sie DAGs, Operatoren und Aufgabenabhängigkeiten in Airflow mit Python, um Pipeline-Läufe zu planen. Airflow ist der am weitesten verbreitete Orchestrator in der Datentechnik.
Lektion 5 • Überwachung und Alarmierung in der Orchestrierung
Verwenden Sie Orchestrator-UIs, Logs und externe Alarmierungsintegrationen, um den Pipeline-Zustand zu verfolgen. Schließt die Observability-Schleife für End-to-End-Pipeline-Operationen.
Kapitel 8AusblendenDetails ausblendenDetails anzeigenLeistung, Testen und Produktionsreife
Leistung, Testen und Produktionsreife
Lektion 1 • Codequalität und Paketierung
Erzwingen Sie Stil mit Lintern, typisieren Sie mit mypy und paketieren Sie Pipeline-Code als installierbare Python-Module. Hebt die Wartbarkeit des Codes auf professionelle Software-Engineering-Standards an.
Lektion 2 • Unit- und Integrationstests für Pipelines
Schreiben Sie pytest-basierte Unit-Tests für Transformationsfunktionen und Integrationstests für Datenbankinteraktionen. Tests verhindern Regressionen und validieren die Pipeline-Korrektheit.
Lektion 3 • Parallele und nebenläufige Verarbeitung
Wenden Sie Multiprocessing-, Threading- und Async-Muster an, um I/O-gebundene und CPU-gebundene Pipeline-Aufgaben zu parallelisieren. Reduziert die End-to-End-Pipeline-Laufzeit erheblich.
Lektion 4 • Profilerstellung und Optimierung von Python-Code
Identifizieren Sie Engpässe mit Profiling-Tools und wenden Sie Vektorisierung, Chunking und Caching an, um den Durchsatz zu verbessern. Die Leistungsoptimierung ist entscheidend für groß angelegte Datenpipelines.
Lektion 5 • CI/CD für das Deployment von Datenpipelines
Automatisieren Sie das Testen, Linting und Deployment von Pipeline-Code mit CI/CD-Pipelines, die durch Versionskontrollereignisse ausgelöst werden. Ermöglicht sichere, wiederholbare Produktions-Releases.
Ihr gültiges Abschlusszertifikat
Dieser Kurs ist für Sie geeignet:
Junior-Datenanalyst: bereit, repetitive Daten-Workflows mit Python zu automatisieren.
SQL-Entwickler: Sie möchten Ihre Fähigkeiten auf die programmatische Erstellung von Pipelines erweitern.
Softwareentwickler: Wechsel in den Bereich Data Engineering mit allgemeinem Programmierhintergrund.
Business-Intelligence-Engineer: mit dem Ziel, die vollständige Datenpipeline von Ende zu Ende zu verantworten.
Absolventin oder Absolvent der Informatik: auf der Suche nach praktischer, berufsrelevanter Erfahrung in der Datenverarbeitung.
Autodidaktischer Programmierer: begeistert von Daten und strebt eine Ingenieurstätigkeit an.
Was unsere Lernenden sagen
Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...

Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.

Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!

Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.

Wichtige Qualifikationen
FAQ
Wer ist Dedika?
Ist das Zertifikat in Deutschland gültig?
Sind die Kurse kostenlos?
Wie hoch ist der Arbeitsaufwand der Kurse?
Wie sind die Kurse aufgebaut?
Wie funktionieren die Kurse?
Wie lange dauern die Kurse?
Was kostet ein Kurs?
Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?
PDF-Kurs




















