Wählen Sie Ihre Sprache aus
Data Lake Kurs
Mehr als 2 Millionen Studierende weltweit

Data Lake Kurs

Beherrschen Sie jede Ebene des modernen Data-Lake-Engineerings, von der Rohdaten-Ingestion bis hin zu verwalteten, analysierbaren Lakehouses. Dieser Kurs deckt Architektur, Speicherung, Verarbeitung, Sicherheit und DataOps in einem umfassenden Programm ab. Egal, ob Sie Ihren ersten Lake aufbauen oder eine Unternehmensplattform skalieren – Sie gewinnen die praktische Expertise, um echten geschäftlichen Mehrwert zu liefern.

Dedika für Unternehmen

Was Sie lernen werden:

Sie lernen, wie Sie produktionsreife Data Lakes entwerfen und betreiben, beginnend mit Kernarchitekturkonzepten und fortschreitend durch Speicherformate, Ingestion-Pipelines, Metadatenverwaltung und Governance. Sie setzen offene Tabellenformate wie Delta Lake, Apache Iceberg und Apache Hudi um, um ACID-Transaktionen und Time Travel auf den Lake-Speicher zu bringen. Der Kurs behandelt auch verteilte Verarbeitung, Abfrage-Engine-Konfiguration, Streaming-Architekturen und ML-Integration. Sie wenden DataOps-Praktiken wie CI/CD, Infrastructure as Code und Datenverträge an, um die Pipeline-Bereitstellung zu automatisieren. Schließlich lernen Sie Kostenmanagement, Observability und wie Sie den Wert des Data Lakes gegenüber Führungskräften kommunizieren.

Wie Sie praxisnah lernen Data Lake Kurs

Wie Sie üben Data Lake Kurs

Für Unternehmen, die ihr Team schulen möchten

Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.

Hier klicken

Kursinhalt

8 Kapitel • 39 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)

Kapitel 1Details anzeigen

Grundlagen der Data-Lake-Architektur

  • Lektion 1 • Was ist ein Data Lake?

    Definiert Data Lakes und stellt sie Data Warehouses und Data Marts gegenüber. Liefert die konzeptionelle Grundlage für alle nachfolgenden Architekturentscheidungen.

  • Lektion 2 • Häufige Fallstricke und das Problem des Data Swamp

    Identifiziert Governance-Fehler, die Data Lakes in unbrauchbare Data Swamps verwandeln. Das Bewusstsein für diese Risiken motiviert die später eingeführten Best Practices.

  • Lektion 3 • Anwendungsfälle und geschäftlicher Wert von Data Lakes

    Ordnet reale Szenarien – Analytik, ML, Archivierung – den Fähigkeiten von Data Lakes zu. Studierende verknüpfen technische Funktionen mit messbaren Geschäftsergebnissen.

  • Lektion 4 • Kernmerkmale von Data Lakes

    Untersucht Schema-on-Read, die Aufnahme mehrerer Formate und Skalierbarkeit als bestimmende Merkmale. Diese Eigenschaften erklären, warum sich Data Lakes für unterschiedliche analytische Workloads eignen.

Kapitel 2Details anzeigen

Data-Lake-Speicherung und Dateiformate

  • Lektion 1 • Speicher-Tiering und Kostenoptimierung

    Erklärt die Speicherstufen Hot, Warm und Cold sowie automatisierte Tiering-Richtlinien. Studierende entwerfen kosteneffektive Aufbewahrungsstrategien, die auf Zugriffsmuster abgestimmt sind.

  • Lektion 2 • Kompressionsstrategien für Data Lakes

    Behandelt die Kompromisse zwischen Kompressionsrate und Geschwindigkeit bei Snappy, Gzip, Zstd und LZ4. Eine korrekte Komprimierung senkt die Speicherkosten, ohne die Abfrageleistung zu beeinträchtigen.

  • Lektion 3 • Spaltenorientierte und zeilenbasierte Dateiformate

    Vergleicht Parquet, ORC, Avro, CSV und JSON für Analyseaufgaben. Die Formatwahl beeinflusst direkt die Abfragegeschwindigkeit und die Speichereffizienz.

  • Lektion 4 • Objektspeicherung als Grundlage

    Erklärt die Mechanik der Objektspeicherung, Bucket-Organisation und Haltbarkeitsgarantien. Die Objektspeicherung ist die dominierende physische Schicht für moderne Data Lakes.

  • Lektion 5 • Best Practices für Partitionierung und Dateigröße

    Vermittelt die Auswahl von Partitionsschlüsseln, Partition Pruning und optimale Dateigrößen. Diese Techniken verhindern Probleme mit kleinen Dateien und beschleunigen analytische Abfragen.

Kapitel 3Details anzeigen

Datenaufnahmemuster und Pipelines

  • Lektion 1 • Pipeline-Zuverlässigkeit und Überwachung

    Lehrt Dead-Letter-Queues, Datenqualitätsprüfungen bei der Aufnahme und Pipeline-Beobachtbarkeit. Zuverlässige Pipelines verhindern stillen Datenverlust und nachgelagerte Korruption.

  • Lektion 2 • Grundlagen der Streaming-Aufnahme

    Führt Konzepte des Event-Streamings, Message Broker und Exactly-Once-Semantik ein. Die Streaming-Aufnahme ermöglicht nahezu Echtzeitanalysen kontinuierlich eingehender Daten.

  • Lektion 3 • Überblick über die Aufnahmearchitektur

    Ordnet Aufnahmemuster Quellentypen und Latenzanforderungen zu. Dieser Überblick gibt den Rahmen für die im gesamten Kapitel behandelten Entwurfsentscheidungen vor.

  • Lektion 4 • Aufnahme aus verschiedenen Quellentypen

    Behandelt Datenbanken, APIs, Dateien, IoT-Geräte und SaaS-Plattformen als Aufnahmequellen. Jeder Quellentyp erfordert spezifische Konnektoren und Schema-Handhabungsstrategien.

  • Lektion 5 • Entwurf der Batch-Aufnahme

    Behandelt geplante Extraktion, Voll- vs. inkrementelle Ladevorgänge und Change Data Capture. Die Batch-Aufnahme bleibt das häufigste Muster für strukturierte Quellsysteme.

Kapitel 4Details anzeigen

Data-Lake-Organisation und Metadatenverwaltung

  • Lektion 1 • Technische und geschäftliche Metadaten

    Unterscheidet technische Metadaten (Schema, Lineage) von geschäftlichen Metadaten (Eigentümerschaft, Glossar). Beide Arten sind für effektive Datenentdeckung und Governance erforderlich.

  • Lektion 2 • Zonenbasierte Lake-Architektur

    Führt Rohdaten-, bereinigte, kuratierte und Sandbox-Zonen mit klaren Promotionskriterien ein. Die Zonentrennung erzwingt Datenqualitätsgrenzen und Zugriffskontrolle.

  • Lektion 3 • Daten-Lineage-Verfolgung

    Erklärt die Erfassung und Visualisierung von Lineage auf Spalten- und Datensatzebene. Lineage ermöglicht Auswirkungsanalysen und schafft Vertrauen der Verbraucher in Datenbestände.

  • Lektion 4 • Namenskonventionen und Ordnerstrukturen

    Legt Standards für Bucket-Namen, Präfixe und Datensatzkennungen fest. Konsistente Benennung ermöglicht Automatisierung, Auffindbarkeit und Governance in großem Maßstab.

  • Lektion 5 • Entwurf und Implementierung von Datenkatalogen

    Behandelt Katalogarchitektur, Crawler und Suchschnittstellen zur Datensatzermittlung. Ein gut gestalteter Katalog verkürzt die Zeit bis zur Erkenntnisgewinnung für Datenkonsumenten.

Kapitel 5Details anzeigen

Daten-Governance und Sicherheit in Data Lakes

  • Lektion 1 • Zugriffskontrollmodelle für Data Lakes

    Vergleicht rollenbasierte, attributbasierte und Zugriffskontrollmodelle auf Zeilen-/Spaltenebene. Die Wahl des richtigen Modells balanciert Sicherheit mit betrieblicher Flexibilität aus.

  • Lektion 2 • Datenmaskierung und Anonymisierung

    Behandelt Techniken der statischen Maskierung, dynamischen Maskierung, Tokenisierung und Pseudonymisierung. Diese Methoden schützen sensible Daten, während sie den analytischen Nutzen bewahren.

  • Lektion 3 • Verschlüsselung ruhender und übertragener Daten

    Erklärt serverseitige Verschlüsselung, clientseitige Verschlüsselung und TLS für Daten in Bewegung. Verschlüsselung ist die grundlegende Kontrolle zum Schutz von Lake-Daten vor unbefugtem Zugriff.

  • Lektion 4 • Audit-Logging und Compliance-Berichterstattung

    Entwirft Audit-Log-Pipelines, Aufbewahrungsrichtlinien und Compliance-Dashboards. Prüfpfade belegen die Wirksamkeit der Kontrollen gegenüber internen und externen Prüfern.

  • Lektion 5 • Datenklassifizierung und Sensitivitäts-Tagging

    Definiert Klassifizierungsstufen – öffentlich, intern, vertraulich, eingeschränkt – und Tagging-Workflows. Die Klassifizierung steuert nachgelagerte Zugriffs- und Maskierungsentscheidungen.

Kapitel 6Details anzeigen

Datenverarbeitung und Transformation im großen Maßstab

  • Lektion 1 • Grundlagen der verteilten Verarbeitung

    Führt verteilte Ausführungsmodelle, DAGs und Shuffle-Operationen ein. Das Verständnis dieser Mechanismen ist Voraussetzung für die Optimierung groß angelegter Transformations-Jobs.

  • Lektion 2 • Transformationsregeln für Datenqualität

    Implementiert Validierung, Standardisierung, Deduplizierung und Anreicherung als Transformationsschritte. Die Einbettung von Qualitätsregeln in Pipelines verhindert, dass schlechte Daten die Verbraucher erreichen.

  • Lektion 3 • Pipeline-Performance-Optimierung

    Wendet Caching, Partition Pruning, Predicate Pushdown und Job Tuning an, um die Laufzeit zu reduzieren. Optimierte Pipelines senken die Rechenkosten und erfüllen SLA-Anforderungen.

  • Lektion 4 • Muster für Streaming-Transformationen

    Lehrt zustandsbehaftete Stream-Verarbeitung, Watermarks und die Handhabung verspätet eintreffender Daten. Streaming-Transformationen ermöglichen kontinuierliche Analysen von Echtzeit-Datenströmen.

  • Lektion 5 • Muster für Batch-Transformationen

    Behandelt Filter-, Join-, Aggregations- und Fensteroperationen auf großen Datensätzen. Diese Muster bilden die Bausteine aller analytischen Transformationspipelines.

Kapitel 7Details anzeigen

Offene Tabellenformate und Lakehouse-Architektur

  • Lektion 1 • Entwurf der Lakehouse-Architektur

    Integriert offene Tabellenformate mit Abfrage-Engines, BI-Tools und ML-Plattformen in ein einheitliches Lakehouse. Diese Architektur macht in vielen Szenarien ein separates Data Warehouse überflüssig.

  • Lektion 2 • Apache Iceberg und Apache Hudi

    Vergleicht Icebergs versteckte Partitionierung und Hudis Upserts auf Datensatzebene mit Delta Lake. Studierende wählen das richtige Format basierend auf Workload- und Ökosystemanforderungen aus.

  • Lektion 3 • Einschränkungen traditioneller Data Lakes

    Identifiziert Lücken bei Konsistenz, Aktualisierungen und Time Travel in einfachen Objektspeicher-Lakes. Diese Einschränkungen motivieren die Einführung offener Tabellenformate.

  • Lektion 4 • Konzepte offener Tabellenformate

    Erklärt Metadatenschichten, Transaktionslogs und Snapshot-Isolation, die allen offenen Formaten gemeinsam sind. Ein gemeinsames konzeptionelles Modell vereinfacht den Vergleich spezifischer Implementierungen.

  • Lektion 5 • Tiefer Einblick in Delta Lake

    Behandelt Delta-Log-Mechanik, MERGE-Operationen, Z-Ordering und Vacuum-Befehle. Delta Lake ist weit verbreitet und dient als primäre Implementierungsreferenz.

Kapitel 8Details anzeigen

Data-Lake-Betrieb und strategische Governance

  • Lektion 1 • Datenaufbewahrung und Lebenszyklus-Governance

    Entwirft Aufbewahrungspläne, Lösch-Workflows und rechtliche Halteprozesse. Lebenszyklus-Governance reduziert Risiko und Speicherkosten, während sie regulatorische Verpflichtungen erfüllt.

  • Lektion 2 • Data Mesh und föderierte Eigentümerschaft

    Wendet Data-Mesh-Prinzipien – Domain-Eigentum, Datenprodukte und föderierte Governance – auf große Lakes an. Föderierte Modelle skalieren Governance über die Kapazität eines zentralen Teams hinaus.

  • Lektion 3 • Fahrplanplanung und Reifegradbewertung

    Verwendet Reifegradmodelle zur Bewertung der aktuellen Lake-Fähigkeiten und Priorisierung von Verbesserungsinitiativen. Ein strukturierter Fahrplan stimmt technische Investitionen mit der Geschäftsstrategie ab.

  • Lektion 4 • Kostenmanagement und FinOps für Data Lakes

    Wendet Tagging, Showback, Chargeback und Right-Sizing zur Kontrolle der Lake-Ausgaben an. Kostentransparenz fördert Verantwortlichkeit und verhindert unkontrolliertes Speicher- und Rechenwachstum.

  • Lektion 5 • Beobachtbarkeit und Überwachung

    Baut Überwachungsstapel auf, die Pipeline-Gesundheit, Datenaktualität und Speichermetriken abdecken. Beobachtbarkeit ermöglicht proaktive Problemlösung, bevor Verbraucher betroffen sind.

Zertifizierung

Ihr gültiges Abschlusszertifikat

Dieser Kurs ist für Sie geeignet:

  • Dateningenieure, die über einfache Pipeline-Arbeit hinausgehen möchten.

  • Cloud-Architekten, die skalierbare Speicherlösungen für Analyse-Teams entwerfen.

  • BI-Entwickler, deren Berichtsanforderungen über die Grenzen traditioneller Data Warehouses hinauswachsen.

  • Softwareingenieure, die in Dateninfrastruktur- und Plattformrollen wechseln.

  • IT-Manager, die Datenstrategie beaufsichtigen und schnelle technische Tiefe benötigen.

  • Analytikingenieure, die reproduzierbare, ML-bereite Datensätze aus Rohquellen erstellen.

Was unsere Lernenden sagen

Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...
Giulio Carlo
Giulio CarloStudent für Digitales Marketing
Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.
Mariana Ferres
Mariana FerresStudentin für Fotografie
Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!
Luciana Alvarenga
Luciana AlvarengaStudentin für Nageldesign
Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.
André Felipe
André FelipeStudent für Prompt Engineering

Wichtige Qualifikationen

FAQ

Wer ist Dedika?

Ist das Zertifikat in Deutschland gültig?

Sind die Kurse kostenlos?

Wie hoch ist der Arbeitsaufwand der Kurse?

Wie sind die Kurse aufgebaut?

Wie funktionieren die Kurse?

Wie lange dauern die Kurse?

Was kostet ein Kurs?

Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?

PDF-Kurs