Wählen Sie Ihre Sprache aus
Apache Hive: Design, Query, and Optimize Big Data Course
Mehr als 2 Millionen Studierende weltweit

Apache Hive: Design, Query, and Optimize Big Data Course

Meistern Sie Apache Hive von Grund auf – Schema-Design, das Schreiben leistungsfähiger HiveQL-Abfragen und die Optimierung der Leistung bei massiven Datensätzen. Dieser Kurs behandelt alles von HDFS-Grundlagen und ACID-Transaktionen bis hin zu Cloud-Deployment, Sicherheit und Workflow-Orchestrierung. Ganz gleich, ob Sie unternehmenskritische Datenpipelines aufbauen oder ein Data Lakehouse optimieren, Sie erwerben die praktischen Fähigkeiten, die Produktionsumgebungen verlangen.

Dedika für Unternehmen

Was Sie lernen werden:

  • Entwerfen Sie verwaltete und externe Hive-Tabellen mit Partitionierung, Bucketing und spaltenorientierten Speicherformaten.

  • Schreiben Sie fortgeschrittene HiveQL-Abfragen mit Fensterfunktionen, CTEs, Unterabfragen und Multi-Tabellen-Joins.

  • Optimieren Sie die Abfrageausführung durch die Anwendung von Partition Pruning, Vektorisierung und kostenbasiertem Optimizer-Tuning.

  • Setzen Sie Hive-Sicherheit mittels Kerberos-Authentifizierung, Apache Ranger-Richtlinien und dynamischer Datenmaskierung um.

  • Integrieren Sie Hive mit Apache Spark, Cloud-Objektspeicher und offenen Tabellenformaten wie Apache Iceberg.

  • Automatisieren Sie Datenpipelines mit Apache Airflow und Oozie, einschließlich inkrementellem Laden und Qualitätsprüfungen.

Wie Sie praxisnah lernen Apache Hive: Design, Query, and Optimize Big Data Course

Wie Sie üben Apache Hive: Design, Query, and Optimize Big Data Course

Für Unternehmen, die ihr Team schulen möchten

Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.

Hier klicken

Kursinhalt

8 Kapitel • 37 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)

Kapitel 1Details anzeigen

Einführung in Big Data und Hive

  • Lektion 1 • Hive-Architektur und -Komponenten

    Erläutert die Kernkomponenten von Hive: Metastore, Driver, Compiler und Execution Engine. Verbindet die Architektur mit dem Verständnis des Abfragelebenszyklus.

  • Lektion 2 • Big-Data-Grundlagen und -Herausforderungen

    Behandelt die Herausforderungen von Datenvolumen, -geschwindigkeit und -vielfalt, die die Einführung von Big Data vorantreiben. Schafft den Kontext dafür, warum verteilte Verarbeitungswerkzeuge wie Hive existieren.

  • Lektion 3 • Einrichten einer Hive-Umgebung

    Leitet die Installation und Konfiguration einer lokalen oder Sandbox-Hive-Umgebung an. Bietet praktische Bereitschaft für alle nachfolgenden Kapitel.

  • Lektion 4 • Hive vs. traditionelle Datenbanken

    Stellt Hives Schema-on-Read-Modell dem Schema-on-Write-Modell von RDBMS gegenüber. Die Teilnehmenden verstehen, wann Hive im Vergleich zu relationalen Alternativen geeignet ist.

Kapitel 2Details anzeigen

HiveQL-Grundlagen und Datentypen

  • Lektion 1 • Primitive und komplexe Datentypen

    Behandelt numerische, Zeichenfolgen-, Boolesche und Datumsprimitive sowie die komplexen Typen ARRAY, MAP und STRUCT. Die korrekte Typauswahl wirkt sich auf Speicherung und Abfragegenauigkeit aus.

  • Lektion 2 • HiveQL-Syntax und Abfragestruktur

    Führt HiveQL als SQL-Dialekt mit Hive-spezifischen Erweiterungen ein. Behandelt SELECT-, FROM-, WHERE- und ORDER BY-Klauseln als Bausteine.

  • Lektion 3 • Aggregation und Gruppierung

    Vermittelt GROUP BY, HAVING und Aggregatfunktionen zur Zusammenfassung von Datensätzen. Die Aggregation ist grundlegend für die im gesamten Kurs verwendeten analytischen Abfragemuster.

  • Lektion 4 • Unterabfragen und Common Table Expressions

    Führt Inline-Ansichten, Unterabfragen und WITH-Klausel-CTEs für den modularen Abfrageentwurf ein. Diese Muster erscheinen in komplexen analytischen Abfragen in späteren Kapiteln.

  • Lektion 5 • Integrierte Funktionen und Operatoren

    Bietet einen Überblick über integrierte Zeichenfolgen-, Mathematik-, Datums- und Bedingungsfunktionen. Die Teilnehmenden wenden Funktionen an, um Daten innerhalb von Abfragen zu transformieren und auszuwerten.

Kapitel 3Details anzeigen

Datenbank- und Tabellendesign in Hive

  • Lektion 1 • Partitionierung von Tabellen

    Vermittelt statische und dynamische Partitionierung, um vollständige Tabellenscans zu reduzieren. Die Partitionierung ist die primäre Technik zur Verbesserung der Abfrageleistung bei großen Tabellen.

  • Lektion 2 • Erstellen und Verwalten von Datenbanken

    Behandelt CREATE DATABASE, DROP DATABASE und Datenbankeigenschaften. Eine ordnungsgemäße Datenbankorganisation unterstützt die teamübergreifende Data Governance.

  • Lektion 3 • Tabellenspeicherformate

    Vergleicht die Speicherformate TextFile, SequenceFile, ORC und Parquet. Die Formatwahl wirkt sich direkt auf die Abfragegeschwindigkeit und Speichereffizienz aus.

  • Lektion 4 • Verwaltete vs. externe Tabellen

    Unterscheidet verwaltete Tabellen (Hive-eigene Daten) von externen Tabellen (benutzereigene Daten). Die richtige Wahl verhindert versehentlichen Datenverlust.

  • Lektion 5 • Bucketing und Clustering

    Führt Bucketing als Ergänzung zur Partitionierung für eine gleichmäßige Datenverteilung ein. Tabellen mit Buckets ermöglichen effizientes Sampling und Join-Optimierung.

Kapitel 4Details anzeigen

Laden, Einfügen und Verwalten von Daten

  • Lektion 1 • Laden von Daten aus Dateien

    Behandelt LOAD DATA LOCAL und LOAD DATA aus HDFS-Pfaden. Das dateibasierte Laden ist das häufigste anfängliche Erfassungsmuster in Hive-Workflows.

  • Lektion 2 • ACID-Transaktionen und CRUD-Operationen

    Erläutert die ACID-Unterstützung von Hive, die UPDATE und DELETE auf ORC-Tabellen ermöglicht. ACID-Operationen erfordern eine spezifische Konfiguration und Tabelleneigenschaften.

  • Lektion 3 • INSERT- und INSERT OVERWRITE-Muster

    Vermittelt INSERT INTO und INSERT OVERWRITE für die abfragegesteuerte Datenbefüllung. Diese Muster unterstützen ETL-Pipelines, die vollständig in HiveQL erstellt werden.

  • Lektion 4 • Exportieren und Archivieren von Daten

    Behandelt INSERT OVERWRITE DIRECTORY und die Befehle EXPORT/IMPORT. Der Datenexport unterstützt die nachgelagerte Nutzung und clusterübergreifende Migration.

Kapitel 5Details anzeigen

Joins, Unions und fortgeschrittene Abfragen

  • Lektion 1 • Skew Joins und Umgang mit Datenschiefe

    Behandelt Join-Schiefe, die durch hochfrequente Schlüsselwerte verursacht wird, die Reducer überlasten. Die Skew-Join-Optimierung verteilt heiße Schlüssel auf mehrere Tasks.

  • Lektion 2 • Join-Typen und Syntax

    Behandelt INNER-, LEFT-, RIGHT-, FULL OUTER- und CROSS-Joins mit HiveQL-Syntax. Das Verständnis der Join-Semantik verhindert falsche Ergebnismengen.

  • Lektion 3 • UNION, INTERSECT und EXCEPT

    Vermittelt Mengenoperationen zum Kombinieren und Vergleichen von Ergebnismengen über Abfragen hinweg. Diese Operationen unterstützen Deduplizierungs- und Differenzanalysemuster.

  • Lektion 4 • Map-Side- und Broadcast-Joins

    Erläutert Map-Side-Joins mit dem MAPJOIN-Hinweis zur Optimierung kleiner Tabellen. Broadcast-Joins eliminieren den Shuffle-Overhead bei Joins zwischen großen und kleinen Tabellen.

  • Lektion 5 • Fensterfunktionen und Analytik

    Führt OVER, PARTITION BY und ORDER BY für Rangfolgen und laufende Aggregationen ein. Fensterfunktionen ermöglichen fortgeschrittene Analytik, ohne die Zeilengranularität zu reduzieren.

Kapitel 6Details anzeigen

Techniken zur Abfrageoptimierung

  • Lektion 1 • Verstehen des Abfrageausführungsplans

    Verwendet EXPLAIN und EXPLAIN EXTENDED, um MapReduce- und Tez-Ausführungspläne zu interpretieren. Das Lesen von Plänen ist die Voraussetzung für alle Optimierungsentscheidungen.

  • Lektion 2 • Optimierung der Tez Execution Engine

    Konfiguriert die Tez-DAG-Ausführung für reduzierte Latenz im Vergleich zu MapReduce. Tez ist die empfohlene Engine für interaktive und iterative Hive-Workloads.

  • Lektion 3 • Partitionsbereinigung und Prädikat-Pushdown

    Stellt sicher, dass Abfragen nur relevante Partitionen scannen und Filter so früh wie möglich weiterschieben. Diese Techniken reduzieren E/A, den dominierenden Kostenfaktor bei Hive-Abfragen.

  • Lektion 4 • Optimierung von Dateiformat und Komprimierung

    Wählt ORC und Parquet mit geeigneten Komprimierungs-Codecs aus, um die Scanzeit zu minimieren. Die Komprimierung reduziert sowohl die Speicherkosten als auch die Netzwerk-E/A während der Abfrageausführung.

  • Lektion 5 • Vektorisierung und kostenbasierter Optimizer

    Aktiviert die vektorisierte Abfrageausführung und den kostenbasierten Optimizer (CBO) zur automatischen Planverbesserung. Beide erfordern die Erfassung von Statistiken, um korrekt zu funktionieren.

Kapitel 7Details anzeigen

Benutzerdefinierte Funktionen und Erweiterbarkeit

  • Lektion 1 • Benutzerdefinierte Tabellenfunktionen

    Erstellt UDTFs, die mit der UDTF-Schnittstelle mehrere Zeilen aus einer einzelnen Eingabezeile ausgeben. UDTFs unterstützen das Aufbrechen verschachtelter Strukturen und die benutzerdefinierte Zeilengenerierung.

  • Lektion 2 • Benutzerdefinierte Aggregatfunktionen

    Implementiert UDAFs mit den Schnittstellen UDAF und GenericUDAF für benutzerdefinierte Aggregationen. UDAFs arbeiten über Reducer-Gruppen hinweg und erfordern eine Pufferverwaltung.

  • Lektion 3 • Grundlagen der UDF-Entwicklung

    Behandelt die UDF-Basisklasse, die evaluate-Methode und die JAR-Paketierung für einfache Skalarfunktionen. UDFs schließen Lücken, wo integrierte Funktionen nicht ausreichen.

  • Lektion 4 • Python- und skriptbasierte Transformationen

    Verwendet TRANSFORM und Streaming-Skripte, um Python- oder Shell-Logik in HiveQL anzuwenden. Skripttransformationen ermöglichen schnelles Prototyping ohne Java-Kompilierung.

Kapitel 8Details anzeigen

Hive in der Produktion: Sicherheit und Governance

  • Lektion 1 • Metastore-Verwaltung und Hochverfügbarkeit

    Konfiguriert einen Remote-Metastore mit einem relationalen Backend und Hochverfügbarkeits-Setup. Die Zuverlässigkeit des Metastore ist entscheidend für einen unterbrechungsfreien Hive-Dienst in der Produktion.

  • Lektion 2 • Autorisierungsmodelle: SQL-Standards und Ranger

    Vergleicht die SQL-Standardautorisierung von Hive mit der richtlinienbasierten Steuerung von Apache Ranger. Fein abgestufte Autorisierung erzwingt den Zugriff mit geringsten Rechten auf Spaltenebene.

  • Lektion 3 • Authentifizierung und Kerberos-Integration

    Konfiguriert die Kerberos-basierte Authentifizierung für HiveServer2 und Client-Verbindungen. Die Authentifizierung verhindert unbefugten Zugriff auf sensible Datenbestände.

  • Lektion 4 • Datenmaskierung und Verschlüsselung

    Wendet dynamische Datenmaskierungsrichtlinien und HDFS-Verschlüsselungszonen an, um sensible Spalten zu schützen. Die Maskierung ermöglicht Analysen sensibler Daten, ohne die Rohwerte preiszugeben.

  • Lektion 5 • Auditierung und Compliance-Protokollierung

    Aktiviert Abfrageauditprotokolle über HiveServer2 und Apache Ranger-Auditpfade. Auditprotokolle erfüllen die gesetzlichen Compliance-Anforderungen für die Nachverfolgung von Datenzugriffen.

Zertifizierung

Ihr gültiges Abschlusszertifikat

Dieser Kurs ist für Sie geeignet:

  • Datenanalysten, die bereit sind, ihre Fähigkeiten über Tabellenkalkulationen und SQL hinaus zu skalieren.

  • Softwareentwickler, die in Rollen im Bereich Big Data und verteilte Systeme wechseln.

  • ETL-Entwickler, die Pipelines mit Hadoop-basierten Werkzeugen modernisieren möchten.

  • Datenbankadministratoren, die sich mit spaltenorientierter Speicherung und umfangreicher Abfrageoptimierung befassen.

  • Business-Intelligence-Experten, deren Datensätze über relationale Datenbanken hinausgewachsen sind.

  • Cloud-Ingenieure, die mit dem Aufbau oder der Migration von Data-Warehouse-Infrastrukturen beauftragt sind.

Was unsere Lernenden sagen

Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...
Giulio Carlo
Giulio CarloStudent für Digitales Marketing
Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.
Mariana Ferres
Mariana FerresStudentin für Fotografie
Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!
Luciana Alvarenga
Luciana AlvarengaStudentin für Nageldesign
Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.
André Felipe
André FelipeStudent für Prompt Engineering

Wichtige Qualifikationen

FAQ

Wer ist Dedika?

Ist das Zertifikat in Deutschland gültig?

Sind die Kurse kostenlos?

Wie hoch ist der Arbeitsaufwand der Kurse?

Wie sind die Kurse aufgebaut?

Wie funktionieren die Kurse?

Wie lange dauern die Kurse?

Was kostet ein Kurs?

Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?

PDF-Kurs