Wählen Sie Ihre Sprache aus
Python Data Engineering Kurs
Mehr als 2 Millionen Studierende weltweit

Python Data Engineering Kurs

Meistern Sie die Python-Fähigkeiten, die Data Engineers täglich einsetzen – vom Erstellen von ETL-Pipelines und der Verbindung zu Datenbanken über das Orchestrieren von Workflows bis hin zum Deployment von produktionsreifem Code. Dieser Kurs führt Sie von den Python-Grundlagen hin zu fortgeschrittenen Data-Engineering-Mustern, die in großem Maßstab eingesetzt werden.

Dedika für Unternehmen

Was Sie lernen werden:

Sie lernen, Python-Skripte zu schreiben, die Daten aus APIs, Dateien und Datenbanken extrahieren und diese dann transformieren und in relationale Datenbanken, Data Warehouses und Cloud-Speicher laden. Sie arbeiten mit Pandas zur Datenmanipulation, SQLAlchemy für Datenbankkonnektivität und Apache Airflow zur Pipeline-Orchestrierung. Der Kurs behandelt die Validierung der Datenqualität, Leistungsoptimierung, parallele Verarbeitung und CI/CD-Praktiken für das Pipeline-Deployment. Sie untersuchen auch PySpark für die verteilte Verarbeitung, Kafka für Streaming-Pipelines und Sicherheits-Best-Practices zum Schutz sensibler Daten in Produktionsumgebungen.

Wie Sie praxisnah lernen Python Data Engineering Kurs

Wie Sie üben Python Data Engineering Kurs

Für Unternehmen, die ihr Team schulen möchten

Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.

Hier klicken

Kursinhalt

8 Kapitel • 37 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)

Kapitel 1Details anzeigen

Python-Grundlagen für Dateningenieure

  • Lektion 1 • Ablaufsteuerung und Iteration

    Wenden Sie Bedingungen, Schleifen und Comprehensions an, um Sequenzen von Datensätzen zu verarbeiten. Dies wird direkt auf die zeilenbasierte Transformationslogik in ETL-Pipelines abgebildet.

  • Lektion 2 • Funktionen und Fehlerbehandlung

    Definieren Sie wiederverwendbare Funktionen mit Argumenten, Standardwerten und Rückgabewerten und behandeln Sie dann Ausnahmen ordnungsgemäß. Ermöglicht modularen, fehlertoleranten Pipeline-Code.

  • Lektion 3 • Kern-Python-Syntax und Datentypen

    Behandeln Sie Variablen, Operatoren und eingebaute Typen wie Zeichenketten, Ganzzahlen, Gleitkommazahlen und boolesche Werte. Bietet die syntaktische Grundlage für das Schreiben jeglicher Datenpipeline-Logik.

  • Lektion 4 • Sammlungen: Listen, Tupel, Dicts, Sets

    Erkunden Sie veränderbare und unveränderbare Sammlungstypen und ihre Leistungskompromisse. Diese Strukturen untermauern die gesamte In-Memory-Datenmanipulation im Kurs.

  • Lektion 5 • Einrichten der Python-Umgebung

    Installieren Sie Python, konfigurieren Sie virtuelle Umgebungen und wählen Sie eine für die Datenarbeit geeignete IDE aus. Etabliert den reproduzierbaren Arbeitsbereich, von dem alle nachfolgenden Kapitel abhängen.

Kapitel 2Details anzeigen

Datei-E/A und Datenserialisierung

  • Lektion 1 • Binärformate: Parquet und Avro

    Lesen und schreiben Sie spaltenorientierte Parquet- und zeilenbasierte Avro-Dateien mit Python-Bibliotheken. Diese Formate sind Standard in modernen Data-Lake-Architekturen.

  • Lektion 2 • Arbeiten mit Text- und CSV-Dateien

    Öffnen, lesen und schreiben Sie Textdateien mit Kontextmanagern und parsen Sie dann CSV mit der Standardbibliothek. Behandelt das häufigste Rohdatenformat in Batch-Pipelines.

  • Lektion 3 • Dateisystem- und Pfadoperationen

    Navigieren Sie in Verzeichnissen, suchen Sie Dateien mit Glob-Mustern und verwalten Sie Pfade mit den Modulen pathlib und os. Automatisiert Dateisuchschritte, die in Batch-Aufnahme-Workflows üblich sind.

  • Lektion 4 • JSON- und XML-Datenformate

    Parsen und serialisieren Sie JSON-Nutzdaten und navigieren Sie durch XML-Bäume für die API- und Konfigurationsdateiverarbeitung. Verbindet sich mit der realen Aufnahme von REST-API-Antworten.

Kapitel 3Details anzeigen

Datenmanipulation mit Pandas

  • Lektion 1 • DataFrames und Series Grundlagen

    Erstellen Sie DataFrames aus dicts, CSV und JSON und überprüfen Sie dann Struktur und Datentypen. Bildet die Grundlage für alle Pandas-basierten Transformationsarbeiten.

  • Lektion 2 • Filtern, Sortieren und Auswählen

    Wenden Sie boolesche Masken, loc/iloc-Selektoren und Sortieroperationen an, um relevante Datenteilmengen zu isolieren. Unterstützt direkt die Datenqualitätsfilterung in Pipeline-Phasen.

  • Lektion 3 • Aggregation, Gruppierung und Pivotierung

    Fassen Sie Daten mit groupby-, agg- und Pivot-Operationen zusammen, um analytische Ausgaben zu erzeugen. Ermöglicht die Berechnung von Metriken und die Berichterstellung innerhalb von Pipeline-Workflows.

  • Lektion 4 • Datenbereinigung und Typkonvertierung

    Behandeln Sie fehlende Werte, Duplikate und falsche Typen, um bereinigte, konsistente Datensätze zu erzeugen. Die Bereinigung ist der zeitaufwändigste Schritt in realen Datenpipelines.

  • Lektion 5 • Zusammenführen und Verbinden von DataFrames

    Kombinieren Sie Datensätze mit merge, join und concat, um SQL-ähnliche relationale Logik nachzubilden. Unerlässlich für die Denormalisierung von Daten vor dem Laden in analytische Speicher.

Kapitel 4Details anzeigen

Datenbankanbindung und SQL-Integration

  • Lektion 1 • Arbeiten mit NoSQL-Datenbanken

    Verbinden Sie sich mit Dokument- und Schlüssel-Wert-Speichern, führen Sie CRUD-Operationen durch und ordnen Sie Ergebnisse Python-Objekten zu. Erweitert die Pipeline-Konnektivität über relationale Systeme hinaus.

  • Lektion 2 • Relationale Datenbanken mit SQLAlchemy

    Stellen Sie Verbindungen her, spiegeln Sie Schemas und führen Sie rohes SQL mit der Core-API von SQLAlchemy aus. Bietet eine datenbankunabhängige Zugriffsschicht für Pipeline-Code.

  • Lektion 3 • Verbindungspooling und Best Practices

    Konfigurieren Sie Verbindungspools, verwalten Sie Anmeldedaten sicher und vermeiden Sie gängige Anti-Patterns. Gewährleistet Zuverlässigkeit und Sicherheit auf Produktionsniveau im Datenbankzugriffscode.

  • Lektion 4 • Schreiben und Upserting von Daten

    Fügen Sie Datensätze programmatisch mit SQLAlchemy und Pandas to_sql ein, aktualisieren Sie sie und führen Sie Upserts durch. Behandelt den Schreibpfad, der zum Laden von Pipeline-Ausgaben in Datenbanken erforderlich ist.

Kapitel 5Details anzeigen

Erstellen von ETL-Pipelines in Python

  • Lektion 1 • Pipeline-Protokollierung und Observability

    Instrumentieren Sie Pipelines mit strukturierter Protokollierung, Metriken und Alarmierung, um eine operative Überwachung zu ermöglichen. Verwandelt Skripte in beobachtbare, produktionsreife Prozesse.

  • Lektion 2 • Transformationslogik und Geschäftsregeln

    Implementieren Sie Feldzuordnungen, abgeleitete Spalten und Validierungsregeln als reine Python-Funktionen. Kapseln Sie Geschäftslogik in testbaren, wiederverwendbaren Transformationseinheiten.

  • Lektion 3 • Laden von Daten in Zielsysteme

    Schreiben Sie transformierte Daten mit Python-Konnektoren in Datenbanken, Data Warehouses und Objektspeicher. Schließt die Pipeline ab, indem bereinigte Daten an ihr Ziel geliefert werden.

  • Lektion 4 • ETL-Architektur und Entwurfsmuster

    Verstehen Sie Pipeline-Phasen, Datenfluss und gängige Entwurfsmuster wie ELT und Medallion-Architektur. Legt den konzeptionellen Rahmen für alle Pipeline-Implementierungsarbeiten fest.

  • Lektion 5 • Extrahieren von Daten aus APIs

    Rufen Sie Daten mit der requests-Bibliothek von REST-APIs ab, behandeln Sie Paginierung und verwalten Sie Ratenlimits. Behandelt die häufigste moderne Datenquelle für Aufnahmepipelines.

Kapitel 6Details anzeigen

Arbeiten mit Cloud-Speicher und -Diensten

  • Lektion 1 • Infrastructure as Code für Datenpipelines

    Definieren Sie Cloud-Ressourcen programmatisch mit Python-basierten IaC-Tools, um die Umgebungseinrichtung zu automatisieren. Reduziert manuelle Bereitstellung und gewährleistet reproduzierbare Pipeline-Infrastruktur.

  • Lektion 2 • Ereignisgesteuerte Aufnahme mit Message Queues

    Produzieren und konsumieren Sie Nachrichten aus Queues und Streaming-Themen, um die Pipeline-Ausführung auszulösen. Verbindet Python-Pipelines mit ereignisgesteuerten und Echtzeit-Datenarchitekturen.

  • Lektion 3 • Interaktion mit verwalteten Data Warehouses

    Verbinden Sie sich über Python-Konnektoren mit Cloud Data Warehouses, führen Sie Abfragen aus und laden Sie Daten effizient. Ermöglicht Python-Pipelines, analytische Workloads in großem Maßstab zu bedienen.

  • Lektion 4 • Cloud-Objektspeicher mit Python-SDKs

    Laden Sie Objekte in Cloud-Speicher-Buckets mit Provider-SDKs hoch, herunter, listen Sie sie auf und löschen Sie sie. Objektspeicher ist die primäre Landezone für Rohdaten in Cloud-Pipelines.

Kapitel 7Details anzeigen

Pipeline-Orchestrierung und -Planung

  • Lektion 1 • Fehlerbehandlung und Wiederholungsstrategien

    Konfigurieren Sie Wiederholungen, Timeouts und SLA-Alarme, um orchestrierte Pipelines widerstandsfähig gegen vorübergehende Ausfälle zu machen. Reduziert direkt manuelle Eingriffe in Produktionsumgebungen.

  • Lektion 2 • Dynamische DAGs und Parametrisierung

    Generieren Sie DAGs programmatisch und übergeben Sie Laufzeitparameter an Aufgaben für eine flexible Pipeline-Ausführung. Ermöglicht die skalierbare Orchestrierung vieler ähnlicher Pipeline-Varianten.

  • Lektion 3 • Orchestrierungskonzepte und Tool-Landschaft

    Verstehen Sie DAGs, Aufgabenabhängigkeiten und die Rolle von Orchestratoren in der Datentechnik. Bietet die konzeptionelle Grundlage vor der Implementierung von Orchestrierungscode.

  • Lektion 4 • Erstellen von DAGs mit Apache Airflow

    Definieren Sie DAGs, Operatoren und Aufgabenabhängigkeiten in Airflow mit Python, um Pipeline-Läufe zu planen. Airflow ist der am weitesten verbreitete Orchestrator in der Datentechnik.

  • Lektion 5 • Überwachung und Alarmierung in der Orchestrierung

    Verwenden Sie Orchestrator-UIs, Logs und externe Alarmierungsintegrationen, um den Pipeline-Zustand zu verfolgen. Schließt die Observability-Schleife für End-to-End-Pipeline-Operationen.

Kapitel 8Details anzeigen

Leistung, Testen und Produktionsreife

  • Lektion 1 • Codequalität und Paketierung

    Erzwingen Sie Stil mit Lintern, typisieren Sie mit mypy und paketieren Sie Pipeline-Code als installierbare Python-Module. Hebt die Wartbarkeit des Codes auf professionelle Software-Engineering-Standards an.

  • Lektion 2 • Unit- und Integrationstests für Pipelines

    Schreiben Sie pytest-basierte Unit-Tests für Transformationsfunktionen und Integrationstests für Datenbankinteraktionen. Tests verhindern Regressionen und validieren die Pipeline-Korrektheit.

  • Lektion 3 • Parallele und nebenläufige Verarbeitung

    Wenden Sie Multiprocessing-, Threading- und Async-Muster an, um I/O-gebundene und CPU-gebundene Pipeline-Aufgaben zu parallelisieren. Reduziert die End-to-End-Pipeline-Laufzeit erheblich.

  • Lektion 4 • Profilerstellung und Optimierung von Python-Code

    Identifizieren Sie Engpässe mit Profiling-Tools und wenden Sie Vektorisierung, Chunking und Caching an, um den Durchsatz zu verbessern. Die Leistungsoptimierung ist entscheidend für groß angelegte Datenpipelines.

  • Lektion 5 • CI/CD für das Deployment von Datenpipelines

    Automatisieren Sie das Testen, Linting und Deployment von Pipeline-Code mit CI/CD-Pipelines, die durch Versionskontrollereignisse ausgelöst werden. Ermöglicht sichere, wiederholbare Produktions-Releases.

Zertifizierung

Ihr gültiges Abschlusszertifikat

Dieser Kurs ist für Sie geeignet:

  • Junior-Datenanalyst: bereit, repetitive Daten-Workflows mit Python zu automatisieren.

  • SQL-Entwickler: Sie möchten Ihre Fähigkeiten auf die programmatische Erstellung von Pipelines erweitern.

  • Softwareentwickler: Wechsel in den Bereich Data Engineering mit allgemeinem Programmierhintergrund.

  • Business-Intelligence-Engineer: mit dem Ziel, die vollständige Datenpipeline von Ende zu Ende zu verantworten.

  • Absolventin oder Absolvent der Informatik: auf der Suche nach praktischer, berufsrelevanter Erfahrung in der Datenverarbeitung.

  • Autodidaktischer Programmierer: begeistert von Daten und strebt eine Ingenieurstätigkeit an.

Was unsere Lernenden sagen

Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...
Giulio Carlo
Giulio CarloStudent für Digitales Marketing
Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.
Mariana Ferres
Mariana FerresStudentin für Fotografie
Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!
Luciana Alvarenga
Luciana AlvarengaStudentin für Nageldesign
Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.
André Felipe
André FelipeStudent für Prompt Engineering

Wichtige Qualifikationen

FAQ

Wer ist Dedika?

Ist das Zertifikat in Deutschland gültig?

Sind die Kurse kostenlos?

Wie hoch ist der Arbeitsaufwand der Kurse?

Wie sind die Kurse aufgebaut?

Wie funktionieren die Kurse?

Wie lange dauern die Kurse?

Was kostet ein Kurs?

Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?

PDF-Kurs