
Apache Hive: Design, Query, and Optimize Big Data Course
Meistern Sie Apache Hive von Grund auf – Schema-Design, das Schreiben leistungsfähiger HiveQL-Abfragen und die Optimierung der Leistung bei massiven Datensätzen. Dieser Kurs behandelt alles von HDFS-Grundlagen und ACID-Transaktionen bis hin zu Cloud-Deployment, Sicherheit und Workflow-Orchestrierung. Ganz gleich, ob Sie unternehmenskritische Datenpipelines aufbauen oder ein Data Lakehouse optimieren, Sie erwerben die praktischen Fähigkeiten, die Produktionsumgebungen verlangen.
Was Sie lernen werden:
Entwerfen Sie verwaltete und externe Hive-Tabellen mit Partitionierung, Bucketing und spaltenorientierten Speicherformaten.
Schreiben Sie fortgeschrittene HiveQL-Abfragen mit Fensterfunktionen, CTEs, Unterabfragen und Multi-Tabellen-Joins.
Optimieren Sie die Abfrageausführung durch die Anwendung von Partition Pruning, Vektorisierung und kostenbasiertem Optimizer-Tuning.
Setzen Sie Hive-Sicherheit mittels Kerberos-Authentifizierung, Apache Ranger-Richtlinien und dynamischer Datenmaskierung um.
Integrieren Sie Hive mit Apache Spark, Cloud-Objektspeicher und offenen Tabellenformaten wie Apache Iceberg.
Automatisieren Sie Datenpipelines mit Apache Airflow und Oozie, einschließlich inkrementellem Laden und Qualitätsprüfungen.
Wie Sie praxisnah lernen Apache Hive: Design, Query, and Optimize Big Data Course
Wie Sie üben Apache Hive: Design, Query, and Optimize Big Data Course
Für Unternehmen, die ihr Team schulen möchten
Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.
Kursinhalt
8 Kapitel • 37 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)
Kapitel 1AusblendenDetails ausblendenDetails anzeigenEinführung in Big Data und Hive
Einführung in Big Data und Hive
Lektion 1 • Hive-Architektur und -Komponenten
Erläutert die Kernkomponenten von Hive: Metastore, Driver, Compiler und Execution Engine. Verbindet die Architektur mit dem Verständnis des Abfragelebenszyklus.
Lektion 2 • Big-Data-Grundlagen und -Herausforderungen
Behandelt die Herausforderungen von Datenvolumen, -geschwindigkeit und -vielfalt, die die Einführung von Big Data vorantreiben. Schafft den Kontext dafür, warum verteilte Verarbeitungswerkzeuge wie Hive existieren.
Lektion 3 • Einrichten einer Hive-Umgebung
Leitet die Installation und Konfiguration einer lokalen oder Sandbox-Hive-Umgebung an. Bietet praktische Bereitschaft für alle nachfolgenden Kapitel.
Lektion 4 • Hive vs. traditionelle Datenbanken
Stellt Hives Schema-on-Read-Modell dem Schema-on-Write-Modell von RDBMS gegenüber. Die Teilnehmenden verstehen, wann Hive im Vergleich zu relationalen Alternativen geeignet ist.
Kapitel 2AusblendenDetails ausblendenDetails anzeigenHiveQL-Grundlagen und Datentypen
HiveQL-Grundlagen und Datentypen
Lektion 1 • Primitive und komplexe Datentypen
Behandelt numerische, Zeichenfolgen-, Boolesche und Datumsprimitive sowie die komplexen Typen ARRAY, MAP und STRUCT. Die korrekte Typauswahl wirkt sich auf Speicherung und Abfragegenauigkeit aus.
Lektion 2 • HiveQL-Syntax und Abfragestruktur
Führt HiveQL als SQL-Dialekt mit Hive-spezifischen Erweiterungen ein. Behandelt SELECT-, FROM-, WHERE- und ORDER BY-Klauseln als Bausteine.
Lektion 3 • Aggregation und Gruppierung
Vermittelt GROUP BY, HAVING und Aggregatfunktionen zur Zusammenfassung von Datensätzen. Die Aggregation ist grundlegend für die im gesamten Kurs verwendeten analytischen Abfragemuster.
Lektion 4 • Unterabfragen und Common Table Expressions
Führt Inline-Ansichten, Unterabfragen und WITH-Klausel-CTEs für den modularen Abfrageentwurf ein. Diese Muster erscheinen in komplexen analytischen Abfragen in späteren Kapiteln.
Lektion 5 • Integrierte Funktionen und Operatoren
Bietet einen Überblick über integrierte Zeichenfolgen-, Mathematik-, Datums- und Bedingungsfunktionen. Die Teilnehmenden wenden Funktionen an, um Daten innerhalb von Abfragen zu transformieren und auszuwerten.
Kapitel 3AusblendenDetails ausblendenDetails anzeigenDatenbank- und Tabellendesign in Hive
Datenbank- und Tabellendesign in Hive
Lektion 1 • Partitionierung von Tabellen
Vermittelt statische und dynamische Partitionierung, um vollständige Tabellenscans zu reduzieren. Die Partitionierung ist die primäre Technik zur Verbesserung der Abfrageleistung bei großen Tabellen.
Lektion 2 • Erstellen und Verwalten von Datenbanken
Behandelt CREATE DATABASE, DROP DATABASE und Datenbankeigenschaften. Eine ordnungsgemäße Datenbankorganisation unterstützt die teamübergreifende Data Governance.
Lektion 3 • Tabellenspeicherformate
Vergleicht die Speicherformate TextFile, SequenceFile, ORC und Parquet. Die Formatwahl wirkt sich direkt auf die Abfragegeschwindigkeit und Speichereffizienz aus.
Lektion 4 • Verwaltete vs. externe Tabellen
Unterscheidet verwaltete Tabellen (Hive-eigene Daten) von externen Tabellen (benutzereigene Daten). Die richtige Wahl verhindert versehentlichen Datenverlust.
Lektion 5 • Bucketing und Clustering
Führt Bucketing als Ergänzung zur Partitionierung für eine gleichmäßige Datenverteilung ein. Tabellen mit Buckets ermöglichen effizientes Sampling und Join-Optimierung.
Kapitel 4AusblendenDetails ausblendenDetails anzeigenLaden, Einfügen und Verwalten von Daten
Laden, Einfügen und Verwalten von Daten
Lektion 1 • Laden von Daten aus Dateien
Behandelt LOAD DATA LOCAL und LOAD DATA aus HDFS-Pfaden. Das dateibasierte Laden ist das häufigste anfängliche Erfassungsmuster in Hive-Workflows.
Lektion 2 • ACID-Transaktionen und CRUD-Operationen
Erläutert die ACID-Unterstützung von Hive, die UPDATE und DELETE auf ORC-Tabellen ermöglicht. ACID-Operationen erfordern eine spezifische Konfiguration und Tabelleneigenschaften.
Lektion 3 • INSERT- und INSERT OVERWRITE-Muster
Vermittelt INSERT INTO und INSERT OVERWRITE für die abfragegesteuerte Datenbefüllung. Diese Muster unterstützen ETL-Pipelines, die vollständig in HiveQL erstellt werden.
Lektion 4 • Exportieren und Archivieren von Daten
Behandelt INSERT OVERWRITE DIRECTORY und die Befehle EXPORT/IMPORT. Der Datenexport unterstützt die nachgelagerte Nutzung und clusterübergreifende Migration.
Kapitel 5AusblendenDetails ausblendenDetails anzeigenJoins, Unions und fortgeschrittene Abfragen
Joins, Unions und fortgeschrittene Abfragen
Lektion 1 • Skew Joins und Umgang mit Datenschiefe
Behandelt Join-Schiefe, die durch hochfrequente Schlüsselwerte verursacht wird, die Reducer überlasten. Die Skew-Join-Optimierung verteilt heiße Schlüssel auf mehrere Tasks.
Lektion 2 • Join-Typen und Syntax
Behandelt INNER-, LEFT-, RIGHT-, FULL OUTER- und CROSS-Joins mit HiveQL-Syntax. Das Verständnis der Join-Semantik verhindert falsche Ergebnismengen.
Lektion 3 • UNION, INTERSECT und EXCEPT
Vermittelt Mengenoperationen zum Kombinieren und Vergleichen von Ergebnismengen über Abfragen hinweg. Diese Operationen unterstützen Deduplizierungs- und Differenzanalysemuster.
Lektion 4 • Map-Side- und Broadcast-Joins
Erläutert Map-Side-Joins mit dem MAPJOIN-Hinweis zur Optimierung kleiner Tabellen. Broadcast-Joins eliminieren den Shuffle-Overhead bei Joins zwischen großen und kleinen Tabellen.
Lektion 5 • Fensterfunktionen und Analytik
Führt OVER, PARTITION BY und ORDER BY für Rangfolgen und laufende Aggregationen ein. Fensterfunktionen ermöglichen fortgeschrittene Analytik, ohne die Zeilengranularität zu reduzieren.
Kapitel 6AusblendenDetails ausblendenDetails anzeigenTechniken zur Abfrageoptimierung
Techniken zur Abfrageoptimierung
Lektion 1 • Verstehen des Abfrageausführungsplans
Verwendet EXPLAIN und EXPLAIN EXTENDED, um MapReduce- und Tez-Ausführungspläne zu interpretieren. Das Lesen von Plänen ist die Voraussetzung für alle Optimierungsentscheidungen.
Lektion 2 • Optimierung der Tez Execution Engine
Konfiguriert die Tez-DAG-Ausführung für reduzierte Latenz im Vergleich zu MapReduce. Tez ist die empfohlene Engine für interaktive und iterative Hive-Workloads.
Lektion 3 • Partitionsbereinigung und Prädikat-Pushdown
Stellt sicher, dass Abfragen nur relevante Partitionen scannen und Filter so früh wie möglich weiterschieben. Diese Techniken reduzieren E/A, den dominierenden Kostenfaktor bei Hive-Abfragen.
Lektion 4 • Optimierung von Dateiformat und Komprimierung
Wählt ORC und Parquet mit geeigneten Komprimierungs-Codecs aus, um die Scanzeit zu minimieren. Die Komprimierung reduziert sowohl die Speicherkosten als auch die Netzwerk-E/A während der Abfrageausführung.
Lektion 5 • Vektorisierung und kostenbasierter Optimizer
Aktiviert die vektorisierte Abfrageausführung und den kostenbasierten Optimizer (CBO) zur automatischen Planverbesserung. Beide erfordern die Erfassung von Statistiken, um korrekt zu funktionieren.
Kapitel 7AusblendenDetails ausblendenDetails anzeigenBenutzerdefinierte Funktionen und Erweiterbarkeit
Benutzerdefinierte Funktionen und Erweiterbarkeit
Lektion 1 • Benutzerdefinierte Tabellenfunktionen
Erstellt UDTFs, die mit der UDTF-Schnittstelle mehrere Zeilen aus einer einzelnen Eingabezeile ausgeben. UDTFs unterstützen das Aufbrechen verschachtelter Strukturen und die benutzerdefinierte Zeilengenerierung.
Lektion 2 • Benutzerdefinierte Aggregatfunktionen
Implementiert UDAFs mit den Schnittstellen UDAF und GenericUDAF für benutzerdefinierte Aggregationen. UDAFs arbeiten über Reducer-Gruppen hinweg und erfordern eine Pufferverwaltung.
Lektion 3 • Grundlagen der UDF-Entwicklung
Behandelt die UDF-Basisklasse, die evaluate-Methode und die JAR-Paketierung für einfache Skalarfunktionen. UDFs schließen Lücken, wo integrierte Funktionen nicht ausreichen.
Lektion 4 • Python- und skriptbasierte Transformationen
Verwendet TRANSFORM und Streaming-Skripte, um Python- oder Shell-Logik in HiveQL anzuwenden. Skripttransformationen ermöglichen schnelles Prototyping ohne Java-Kompilierung.
Kapitel 8AusblendenDetails ausblendenDetails anzeigenHive in der Produktion: Sicherheit und Governance
Hive in der Produktion: Sicherheit und Governance
Lektion 1 • Metastore-Verwaltung und Hochverfügbarkeit
Konfiguriert einen Remote-Metastore mit einem relationalen Backend und Hochverfügbarkeits-Setup. Die Zuverlässigkeit des Metastore ist entscheidend für einen unterbrechungsfreien Hive-Dienst in der Produktion.
Lektion 2 • Autorisierungsmodelle: SQL-Standards und Ranger
Vergleicht die SQL-Standardautorisierung von Hive mit der richtlinienbasierten Steuerung von Apache Ranger. Fein abgestufte Autorisierung erzwingt den Zugriff mit geringsten Rechten auf Spaltenebene.
Lektion 3 • Authentifizierung und Kerberos-Integration
Konfiguriert die Kerberos-basierte Authentifizierung für HiveServer2 und Client-Verbindungen. Die Authentifizierung verhindert unbefugten Zugriff auf sensible Datenbestände.
Lektion 4 • Datenmaskierung und Verschlüsselung
Wendet dynamische Datenmaskierungsrichtlinien und HDFS-Verschlüsselungszonen an, um sensible Spalten zu schützen. Die Maskierung ermöglicht Analysen sensibler Daten, ohne die Rohwerte preiszugeben.
Lektion 5 • Auditierung und Compliance-Protokollierung
Aktiviert Abfrageauditprotokolle über HiveServer2 und Apache Ranger-Auditpfade. Auditprotokolle erfüllen die gesetzlichen Compliance-Anforderungen für die Nachverfolgung von Datenzugriffen.
Ihr gültiges Abschlusszertifikat
Dieser Kurs ist für Sie geeignet:
Datenanalysten, die bereit sind, ihre Fähigkeiten über Tabellenkalkulationen und SQL hinaus zu skalieren.
Softwareentwickler, die in Rollen im Bereich Big Data und verteilte Systeme wechseln.
ETL-Entwickler, die Pipelines mit Hadoop-basierten Werkzeugen modernisieren möchten.
Datenbankadministratoren, die sich mit spaltenorientierter Speicherung und umfangreicher Abfrageoptimierung befassen.
Business-Intelligence-Experten, deren Datensätze über relationale Datenbanken hinausgewachsen sind.
Cloud-Ingenieure, die mit dem Aufbau oder der Migration von Data-Warehouse-Infrastrukturen beauftragt sind.
Was unsere Lernenden sagen
Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...

Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.

Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!

Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.

Wichtige Qualifikationen
FAQ
Wer ist Dedika?
Ist das Zertifikat in Deutschland gültig?
Sind die Kurse kostenlos?
Wie hoch ist der Arbeitsaufwand der Kurse?
Wie sind die Kurse aufgebaut?
Wie funktionieren die Kurse?
Wie lange dauern die Kurse?
Was kostet ein Kurs?
Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?
PDF-Kurs




















