
Data Lake Kurs
Beherrschen Sie jede Ebene des modernen Data-Lake-Engineerings, von der Rohdaten-Ingestion bis hin zu verwalteten, analysierbaren Lakehouses. Dieser Kurs deckt Architektur, Speicherung, Verarbeitung, Sicherheit und DataOps in einem umfassenden Programm ab. Egal, ob Sie Ihren ersten Lake aufbauen oder eine Unternehmensplattform skalieren – Sie gewinnen die praktische Expertise, um echten geschäftlichen Mehrwert zu liefern.
Was Sie lernen werden:
Sie lernen, wie Sie produktionsreife Data Lakes entwerfen und betreiben, beginnend mit Kernarchitekturkonzepten und fortschreitend durch Speicherformate, Ingestion-Pipelines, Metadatenverwaltung und Governance. Sie setzen offene Tabellenformate wie Delta Lake, Apache Iceberg und Apache Hudi um, um ACID-Transaktionen und Time Travel auf den Lake-Speicher zu bringen. Der Kurs behandelt auch verteilte Verarbeitung, Abfrage-Engine-Konfiguration, Streaming-Architekturen und ML-Integration. Sie wenden DataOps-Praktiken wie CI/CD, Infrastructure as Code und Datenverträge an, um die Pipeline-Bereitstellung zu automatisieren. Schließlich lernen Sie Kostenmanagement, Observability und wie Sie den Wert des Data Lakes gegenüber Führungskräften kommunizieren.
Wie Sie praxisnah lernen Data Lake Kurs
Wie Sie üben Data Lake Kurs
Für Unternehmen, die ihr Team schulen möchten
Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.
Kursinhalt
8 Kapitel • 39 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)
Kapitel 1AusblendenDetails ausblendenDetails anzeigenGrundlagen der Data-Lake-Architektur
Grundlagen der Data-Lake-Architektur
Lektion 1 • Was ist ein Data Lake?
Definiert Data Lakes und stellt sie Data Warehouses und Data Marts gegenüber. Liefert die konzeptionelle Grundlage für alle nachfolgenden Architekturentscheidungen.
Lektion 2 • Häufige Fallstricke und das Problem des Data Swamp
Identifiziert Governance-Fehler, die Data Lakes in unbrauchbare Data Swamps verwandeln. Das Bewusstsein für diese Risiken motiviert die später eingeführten Best Practices.
Lektion 3 • Anwendungsfälle und geschäftlicher Wert von Data Lakes
Ordnet reale Szenarien – Analytik, ML, Archivierung – den Fähigkeiten von Data Lakes zu. Studierende verknüpfen technische Funktionen mit messbaren Geschäftsergebnissen.
Lektion 4 • Kernmerkmale von Data Lakes
Untersucht Schema-on-Read, die Aufnahme mehrerer Formate und Skalierbarkeit als bestimmende Merkmale. Diese Eigenschaften erklären, warum sich Data Lakes für unterschiedliche analytische Workloads eignen.
Kapitel 2AusblendenDetails ausblendenDetails anzeigenData-Lake-Speicherung und Dateiformate
Data-Lake-Speicherung und Dateiformate
Lektion 1 • Speicher-Tiering und Kostenoptimierung
Erklärt die Speicherstufen Hot, Warm und Cold sowie automatisierte Tiering-Richtlinien. Studierende entwerfen kosteneffektive Aufbewahrungsstrategien, die auf Zugriffsmuster abgestimmt sind.
Lektion 2 • Kompressionsstrategien für Data Lakes
Behandelt die Kompromisse zwischen Kompressionsrate und Geschwindigkeit bei Snappy, Gzip, Zstd und LZ4. Eine korrekte Komprimierung senkt die Speicherkosten, ohne die Abfrageleistung zu beeinträchtigen.
Lektion 3 • Spaltenorientierte und zeilenbasierte Dateiformate
Vergleicht Parquet, ORC, Avro, CSV und JSON für Analyseaufgaben. Die Formatwahl beeinflusst direkt die Abfragegeschwindigkeit und die Speichereffizienz.
Lektion 4 • Objektspeicherung als Grundlage
Erklärt die Mechanik der Objektspeicherung, Bucket-Organisation und Haltbarkeitsgarantien. Die Objektspeicherung ist die dominierende physische Schicht für moderne Data Lakes.
Lektion 5 • Best Practices für Partitionierung und Dateigröße
Vermittelt die Auswahl von Partitionsschlüsseln, Partition Pruning und optimale Dateigrößen. Diese Techniken verhindern Probleme mit kleinen Dateien und beschleunigen analytische Abfragen.
Kapitel 3AusblendenDetails ausblendenDetails anzeigenDatenaufnahmemuster und Pipelines
Datenaufnahmemuster und Pipelines
Lektion 1 • Pipeline-Zuverlässigkeit und Überwachung
Lehrt Dead-Letter-Queues, Datenqualitätsprüfungen bei der Aufnahme und Pipeline-Beobachtbarkeit. Zuverlässige Pipelines verhindern stillen Datenverlust und nachgelagerte Korruption.
Lektion 2 • Grundlagen der Streaming-Aufnahme
Führt Konzepte des Event-Streamings, Message Broker und Exactly-Once-Semantik ein. Die Streaming-Aufnahme ermöglicht nahezu Echtzeitanalysen kontinuierlich eingehender Daten.
Lektion 3 • Überblick über die Aufnahmearchitektur
Ordnet Aufnahmemuster Quellentypen und Latenzanforderungen zu. Dieser Überblick gibt den Rahmen für die im gesamten Kapitel behandelten Entwurfsentscheidungen vor.
Lektion 4 • Aufnahme aus verschiedenen Quellentypen
Behandelt Datenbanken, APIs, Dateien, IoT-Geräte und SaaS-Plattformen als Aufnahmequellen. Jeder Quellentyp erfordert spezifische Konnektoren und Schema-Handhabungsstrategien.
Lektion 5 • Entwurf der Batch-Aufnahme
Behandelt geplante Extraktion, Voll- vs. inkrementelle Ladevorgänge und Change Data Capture. Die Batch-Aufnahme bleibt das häufigste Muster für strukturierte Quellsysteme.
Kapitel 4AusblendenDetails ausblendenDetails anzeigenData-Lake-Organisation und Metadatenverwaltung
Data-Lake-Organisation und Metadatenverwaltung
Lektion 1 • Technische und geschäftliche Metadaten
Unterscheidet technische Metadaten (Schema, Lineage) von geschäftlichen Metadaten (Eigentümerschaft, Glossar). Beide Arten sind für effektive Datenentdeckung und Governance erforderlich.
Lektion 2 • Zonenbasierte Lake-Architektur
Führt Rohdaten-, bereinigte, kuratierte und Sandbox-Zonen mit klaren Promotionskriterien ein. Die Zonentrennung erzwingt Datenqualitätsgrenzen und Zugriffskontrolle.
Lektion 3 • Daten-Lineage-Verfolgung
Erklärt die Erfassung und Visualisierung von Lineage auf Spalten- und Datensatzebene. Lineage ermöglicht Auswirkungsanalysen und schafft Vertrauen der Verbraucher in Datenbestände.
Lektion 4 • Namenskonventionen und Ordnerstrukturen
Legt Standards für Bucket-Namen, Präfixe und Datensatzkennungen fest. Konsistente Benennung ermöglicht Automatisierung, Auffindbarkeit und Governance in großem Maßstab.
Lektion 5 • Entwurf und Implementierung von Datenkatalogen
Behandelt Katalogarchitektur, Crawler und Suchschnittstellen zur Datensatzermittlung. Ein gut gestalteter Katalog verkürzt die Zeit bis zur Erkenntnisgewinnung für Datenkonsumenten.
Kapitel 5AusblendenDetails ausblendenDetails anzeigenDaten-Governance und Sicherheit in Data Lakes
Daten-Governance und Sicherheit in Data Lakes
Lektion 1 • Zugriffskontrollmodelle für Data Lakes
Vergleicht rollenbasierte, attributbasierte und Zugriffskontrollmodelle auf Zeilen-/Spaltenebene. Die Wahl des richtigen Modells balanciert Sicherheit mit betrieblicher Flexibilität aus.
Lektion 2 • Datenmaskierung und Anonymisierung
Behandelt Techniken der statischen Maskierung, dynamischen Maskierung, Tokenisierung und Pseudonymisierung. Diese Methoden schützen sensible Daten, während sie den analytischen Nutzen bewahren.
Lektion 3 • Verschlüsselung ruhender und übertragener Daten
Erklärt serverseitige Verschlüsselung, clientseitige Verschlüsselung und TLS für Daten in Bewegung. Verschlüsselung ist die grundlegende Kontrolle zum Schutz von Lake-Daten vor unbefugtem Zugriff.
Lektion 4 • Audit-Logging und Compliance-Berichterstattung
Entwirft Audit-Log-Pipelines, Aufbewahrungsrichtlinien und Compliance-Dashboards. Prüfpfade belegen die Wirksamkeit der Kontrollen gegenüber internen und externen Prüfern.
Lektion 5 • Datenklassifizierung und Sensitivitäts-Tagging
Definiert Klassifizierungsstufen – öffentlich, intern, vertraulich, eingeschränkt – und Tagging-Workflows. Die Klassifizierung steuert nachgelagerte Zugriffs- und Maskierungsentscheidungen.
Kapitel 6AusblendenDetails ausblendenDetails anzeigenDatenverarbeitung und Transformation im großen Maßstab
Datenverarbeitung und Transformation im großen Maßstab
Lektion 1 • Grundlagen der verteilten Verarbeitung
Führt verteilte Ausführungsmodelle, DAGs und Shuffle-Operationen ein. Das Verständnis dieser Mechanismen ist Voraussetzung für die Optimierung groß angelegter Transformations-Jobs.
Lektion 2 • Transformationsregeln für Datenqualität
Implementiert Validierung, Standardisierung, Deduplizierung und Anreicherung als Transformationsschritte. Die Einbettung von Qualitätsregeln in Pipelines verhindert, dass schlechte Daten die Verbraucher erreichen.
Lektion 3 • Pipeline-Performance-Optimierung
Wendet Caching, Partition Pruning, Predicate Pushdown und Job Tuning an, um die Laufzeit zu reduzieren. Optimierte Pipelines senken die Rechenkosten und erfüllen SLA-Anforderungen.
Lektion 4 • Muster für Streaming-Transformationen
Lehrt zustandsbehaftete Stream-Verarbeitung, Watermarks und die Handhabung verspätet eintreffender Daten. Streaming-Transformationen ermöglichen kontinuierliche Analysen von Echtzeit-Datenströmen.
Lektion 5 • Muster für Batch-Transformationen
Behandelt Filter-, Join-, Aggregations- und Fensteroperationen auf großen Datensätzen. Diese Muster bilden die Bausteine aller analytischen Transformationspipelines.
Kapitel 7AusblendenDetails ausblendenDetails anzeigenOffene Tabellenformate und Lakehouse-Architektur
Offene Tabellenformate und Lakehouse-Architektur
Lektion 1 • Entwurf der Lakehouse-Architektur
Integriert offene Tabellenformate mit Abfrage-Engines, BI-Tools und ML-Plattformen in ein einheitliches Lakehouse. Diese Architektur macht in vielen Szenarien ein separates Data Warehouse überflüssig.
Lektion 2 • Apache Iceberg und Apache Hudi
Vergleicht Icebergs versteckte Partitionierung und Hudis Upserts auf Datensatzebene mit Delta Lake. Studierende wählen das richtige Format basierend auf Workload- und Ökosystemanforderungen aus.
Lektion 3 • Einschränkungen traditioneller Data Lakes
Identifiziert Lücken bei Konsistenz, Aktualisierungen und Time Travel in einfachen Objektspeicher-Lakes. Diese Einschränkungen motivieren die Einführung offener Tabellenformate.
Lektion 4 • Konzepte offener Tabellenformate
Erklärt Metadatenschichten, Transaktionslogs und Snapshot-Isolation, die allen offenen Formaten gemeinsam sind. Ein gemeinsames konzeptionelles Modell vereinfacht den Vergleich spezifischer Implementierungen.
Lektion 5 • Tiefer Einblick in Delta Lake
Behandelt Delta-Log-Mechanik, MERGE-Operationen, Z-Ordering und Vacuum-Befehle. Delta Lake ist weit verbreitet und dient als primäre Implementierungsreferenz.
Kapitel 8AusblendenDetails ausblendenDetails anzeigenData-Lake-Betrieb und strategische Governance
Data-Lake-Betrieb und strategische Governance
Lektion 1 • Datenaufbewahrung und Lebenszyklus-Governance
Entwirft Aufbewahrungspläne, Lösch-Workflows und rechtliche Halteprozesse. Lebenszyklus-Governance reduziert Risiko und Speicherkosten, während sie regulatorische Verpflichtungen erfüllt.
Lektion 2 • Data Mesh und föderierte Eigentümerschaft
Wendet Data-Mesh-Prinzipien – Domain-Eigentum, Datenprodukte und föderierte Governance – auf große Lakes an. Föderierte Modelle skalieren Governance über die Kapazität eines zentralen Teams hinaus.
Lektion 3 • Fahrplanplanung und Reifegradbewertung
Verwendet Reifegradmodelle zur Bewertung der aktuellen Lake-Fähigkeiten und Priorisierung von Verbesserungsinitiativen. Ein strukturierter Fahrplan stimmt technische Investitionen mit der Geschäftsstrategie ab.
Lektion 4 • Kostenmanagement und FinOps für Data Lakes
Wendet Tagging, Showback, Chargeback und Right-Sizing zur Kontrolle der Lake-Ausgaben an. Kostentransparenz fördert Verantwortlichkeit und verhindert unkontrolliertes Speicher- und Rechenwachstum.
Lektion 5 • Beobachtbarkeit und Überwachung
Baut Überwachungsstapel auf, die Pipeline-Gesundheit, Datenaktualität und Speichermetriken abdecken. Beobachtbarkeit ermöglicht proaktive Problemlösung, bevor Verbraucher betroffen sind.
Ihr gültiges Abschlusszertifikat
Dieser Kurs ist für Sie geeignet:
Dateningenieure, die über einfache Pipeline-Arbeit hinausgehen möchten.
Cloud-Architekten, die skalierbare Speicherlösungen für Analyse-Teams entwerfen.
BI-Entwickler, deren Berichtsanforderungen über die Grenzen traditioneller Data Warehouses hinauswachsen.
Softwareingenieure, die in Dateninfrastruktur- und Plattformrollen wechseln.
IT-Manager, die Datenstrategie beaufsichtigen und schnelle technische Tiefe benötigen.
Analytikingenieure, die reproduzierbare, ML-bereite Datensätze aus Rohquellen erstellen.
Was unsere Lernenden sagen
Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...

Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.

Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!

Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.

Wichtige Qualifikationen
FAQ
Wer ist Dedika?
Ist das Zertifikat in Deutschland gültig?
Sind die Kurse kostenlos?
Wie hoch ist der Arbeitsaufwand der Kurse?
Wie sind die Kurse aufgebaut?
Wie funktionieren die Kurse?
Wie lange dauern die Kurse?
Was kostet ein Kurs?
Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?
PDF-Kurs




















