Choisissez votre langue
Apache Hive: Design, Query, and Optimize Big Data Course
Plus de 2 millions d'apprenants dans le monde

Apache Hive: Design, Query, and Optimize Big Data Course

Maîtrisez Apache Hive de A à Z — conception de schémas, rédaction de requêtes HiveQL puissantes et réglage des performances sur des ensembles de données massifs. Ce cours couvre tout, des fondamentaux HDFS et des transactions ACID au déploiement dans le nuage, à la sécurité et à l'orchestration des workflows. Que vous construisiez des pipelines de données d'entreprise ou optimisiez un lakehouse de données, vous acquerrez les compétences pratiques qu'exigent les environnements de production.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Concevez des tables Hive gérées et externes avec partitionnement, regroupement et formats de stockage columnaires.

  • Écrivez des requêtes HiveQL avancées en utilisant des fonctions de fenêtre, des CTE, des sous-requêtes et des jointures multi-tables.

  • Optimisez l'exécution des requêtes en appliquant l'élagage de partitions, la vectorisation et le réglage de l'optimiseur basé sur les coûts.

  • Implémentez la sécurité Hive à l'aide de l'authentification Kerberos, des politiques Apache Ranger et du masquage dynamique des données.

  • Intégrez Hive avec Apache Spark, le stockage d'objets dans le nuage et les formats de table ouverts comme Apache Iceberg.

  • Automatisez les pipelines de données avec Apache Airflow et Oozie, y compris le chargement incrémental et les contrôles de qualité.

Comment vous étudiez de façon pratique Apache Hive: Design, Query, and Optimize Big Data Course

Comment vous pratiquez Apache Hive: Design, Query, and Optimize Big Data Course

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Introduction au Big Data et à Hive

  • Leçon 1 • Architecture et Composants de Hive

    Explique les composants principaux de Hive : metastore, pilote, compilateur et moteur d'exécution. Relie l'architecture à la compréhension du cycle de vie d'une requête.

  • Leçon 2 • Fondamentaux et Défis du Big Data

    Couvre les défis de volume, vélocité et variété qui motivent l'adoption du big data. Établit le contexte de l'existence d'outils de traitement distribué comme Hive.

  • Leçon 3 • Installation d'un Environnement Hive

    Guide l'installation et la configuration d'un environnement Hive local ou sandbox. Fournit une préparation pratique pour tous les chapitres suivants.

  • Leçon 4 • Hive vs Bases de Données Traditionnelles

    Compare le modèle schema-on-read de Hive au schema-on-write des RDBMS. Les étudiants comprennent quand Hive est approprié par rapport aux alternatives relationnelles.

Chapitre 2Voir les détails

Fondamentaux de HiveQL et Types de Données

  • Leçon 1 • Types de Données Primitifs et Complexes

    Couvre les primitives numériques, chaînes, booléennes et date, ainsi que les types complexes ARRAY, MAP et STRUCT. Le choix correct du type affecte le stockage et la précision des requêtes.

  • Leçon 2 • Syntaxe HiveQL et Structure des Requêtes

    Introduit HiveQL comme un dialecte SQL avec des extensions spécifiques à Hive. Couvre les clauses SELECT, FROM, WHERE et ORDER BY comme éléments de base.

  • Leçon 3 • Agrégation et Regroupement

    Enseigne GROUP BY, HAVING et les fonctions d'agrégation pour résumer les ensembles de données. L'agrégation est fondamentale pour les modèles de requêtes analytiques utilisés tout au long du cours.

  • Leçon 4 • Sous-requêtes et Expressions de Table Communes

    Introduit les vues en ligne, les sous-requêtes et les CTE avec la clause WITH pour une conception de requêtes modulaire. Ces modèles apparaissent dans les requêtes analytiques complexes des chapitres suivants.

  • Leçon 5 • Fonctions et Opérateurs Intégrés

    Passe en revue les fonctions intégrées de chaîne, mathématiques, de date et conditionnelles. Les étudiants appliquent des fonctions pour transformer et évaluer des données dans les requêtes.

Chapitre 3Voir les détails

Conception de Bases de Données et de Tables dans Hive

  • Leçon 1 • Partitionnement des Tables

    Enseigne le partitionnement statique et dynamique pour réduire les analyses de tables complètes. Le partitionnement est la principale technique pour améliorer les performances des requêtes sur de grandes tables.

  • Leçon 2 • Création et Gestion des Bases de Données

    Couvre CREATE DATABASE, DROP DATABASE et les propriétés des bases de données. Une organisation appropriée des bases de données soutient la gouvernance des données multi-équipe.

  • Leçon 3 • Formats de Stockage des Tables

    Compare les formats de stockage TextFile, SequenceFile, ORC et Parquet. Le choix du format a un impact direct sur la vitesse des requêtes et l'efficacité du stockage.

  • Leçon 4 • Tables Gérées vs Externes

    Distingue les tables gérées (données détenues par Hive) des tables externes (données détenues par l'utilisateur). Un choix correct empêche la perte accidentelle de données.

  • Leçon 5 • Bucketing et Clustering

    Introduit le bucketing comme complément au partitionnement pour une distribution uniforme des données. Les tables buckétées permettent un échantillonnage efficace et une optimisation des jointures.

Chapitre 4Voir les détails

Chargement, Insertion et Gestion des Données

  • Leçon 1 • Chargement de Données à partir de Fichiers

    Couvre LOAD DATA LOCAL et LOAD DATA à partir de chemins HDFS. Le chargement basé sur les fichiers est le modèle d'ingestion initial le plus courant dans les workflows Hive.

  • Leçon 2 • Transactions ACID et Opérations CRUD

    Explique le support ACID de Hive permettant UPDATE et DELETE sur les tables ORC. Les opérations ACID nécessitent une configuration et des propriétés de table spécifiques.

  • Leçon 3 • Modèles INSERT et INSERT OVERWRITE

    Enseigne INSERT INTO et INSERT OVERWRITE pour le peuplement de données piloté par requête. Ces modèles soutiennent les pipelines ETL construits entièrement dans HiveQL.

  • Leçon 4 • Exportation et Archivage de Données

    Couvre INSERT OVERWRITE DIRECTORY et les commandes EXPORT/IMPORT. L'exportation de données prend en charge la consommation en aval et la migration entre clusters.

Chapitre 5Voir les détails

Jointures, Unions et Requêtes Avancées

  • Leçon 1 • Jointures Skew et Gestion de la Skew de Données

    Aborde la skew de jointure causée par des valeurs de clé à haute fréquence qui surchargent les réducteurs. L'optimisation des jointures skew distribue les clés chaudes entre plusieurs tâches.

  • Leçon 2 • Types de Jointures et Syntaxe

    Couvre les jointures INNER, LEFT, RIGHT, FULL OUTER et CROSS avec la syntaxe HiveQL. La compréhension de la sémantique des jointures empêche des ensembles de résultats incorrects.

  • Leçon 3 • UNION, INTERSECT et EXCEPT

    Enseigne les opérations d'ensemble pour combiner et comparer des ensembles de résultats entre requêtes. Ces opérations prennent en charge la déduplication et les modèles d'analyse différentielle.

  • Leçon 4 • Jointures Map-Side et Broadcast

    Explique les jointures map-side utilisant l'indication MAPJOIN pour l'optimisation des petites tables. Les jointures broadcast éliminent la surcharge de shuffle dans les jointures grande table vers petite table.

  • Leçon 5 • Fonctions de Fenêtrage et Analytiques

    Introduit OVER, PARTITION BY et ORDER BY pour le classement et les agrégations courantes. Les fonctions de fenêtrage permettent des analyses avancées sans réduire la granularité des lignes.

Chapitre 6Voir les détails

Techniques d'Optimisation des Requêtes

  • Leçon 1 • Compréhension du Plan d'Exécution des Requêtes

    Utilise EXPLAIN et EXPLAIN EXTENDED pour interpréter les plans d'exécution MapReduce et Tez. La lecture des plans est la compétence prérequise pour toutes les décisions d'optimisation.

  • Leçon 2 • Réglage du Moteur d'Exécution Tez

    Configure l'exécution DAG de Tez pour une latence réduite par rapport à MapReduce. Tez est le moteur recommandé pour les charges de travail Hive interactives et itératives.

  • Leçon 3 • Élagage des Partitions et Pushdown de Prédicats

    Garantit que les requêtes ne parcourent que les partitions pertinentes et poussent les filtres le plus tôt possible. Ces techniques réduisent les E/S, qui sont le coût dominant dans les requêtes Hive.

  • Leçon 4 • Optimisation du Format de Fichier et de la Compression

    Sélectionnez ORC et Parquet avec des codecs de compression appropriés pour minimiser le temps de lecture. La compression réduit à la fois le coût de stockage et les E/S réseau pendant l'exécution des requêtes.

  • Leçon 5 • Vectorisation et Optimiseur Basé sur les Coûts

    Active l'exécution vectorisée des requêtes et l'optimiseur basé sur les coûts (CBO) pour l'amélioration automatique des plans. Les deux nécessitent la collecte de statistiques pour fonctionner correctement.

Chapitre 7Voir les détails

Fonctions Définies par l'Utilisateur et Extensibilité

  • Leçon 1 • Fonctions de Table Définies par l'Utilisateur

    Construit des UDTF qui émettent plusieurs lignes à partir d'une seule ligne d'entrée en utilisant l'interface UDTF. Les UDTF prennent en charge l'explosion de structures imbriquées et la génération personnalisée de lignes.

  • Leçon 2 • Fonctions d'Agrégation Définies par l'Utilisateur

    Implémente les UDAF en utilisant les interfaces UDAF et GenericUDAF pour des agrégations personnalisées. Les UDAF opèrent sur les groupes de réducteurs et nécessitent une gestion de la mémoire tampon.

  • Leçon 3 • Fondamentaux du Développement d'UDF

    Couvre la classe de base UDF, la méthode evaluate et le packaging JAR pour des fonctions scalaires simples. Les UDF comblent les lacunes là où les fonctions intégrées sont insuffisantes.

  • Leçon 4 • Transformations Python et Basées sur des Scripts

    Utilise TRANSFORM et les scripts de streaming pour appliquer une logique Python ou shell dans HiveQL. Les transformations de script permettent un prototypage rapide sans compilation Java.

Chapitre 8Voir les détails

Hive en Production : Sécurité et Gouvernance

  • Leçon 1 • Gestion du Metastore et Haute Disponibilité

    Configure un metastore distant avec un backend relationnel et une configuration haute disponibilité. La fiabilité du metastore est critique pour un service Hive ininterrompu en production.

  • Leçon 2 • Modèles d'Autorisation : Normes SQL et Ranger

    Compare l'autorisation standard SQL de Hive avec le contrôle basé sur les politiques d'Apache Ranger. L'autorisation à granularité fine applique un accès de moindre privilège au niveau des colonnes.

  • Leçon 3 • Authentification et Intégration Kerberos

    Configure l'authentification basée sur Kerberos pour HiveServer2 et les connexions client. L'authentification empêche l'accès non autorisé aux actifs de données sensibles.

  • Leçon 4 • Masquage de Données et Chiffrement

    Applique des politiques de masquage dynamique de données et des zones de chiffrement HDFS pour protéger les colonnes sensibles. Le masquage permet l'analyse de données sensibles sans exposer les valeurs brutes.

  • Leçon 5 • Audit et Journalisation de Conformité

    Active les journaux d'audit des requêtes via HiveServer2 et les pistes d'audit d'Apache Ranger. Les journaux d'audit satisfont aux exigences de conformité réglementaire pour le suivi de l'accès aux données.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analystes de données prêts à développer leurs compétences au-delà des tableurs et du SQL.

  • Ingénieurs logiciels en transition vers les rôles liés aux big data et aux systèmes distribués.

  • Développeurs ETL qui souhaitent moderniser les pipelines à l'aide d'outils basés sur Hadoop.

  • Administrateurs de bases de données explorant le stockage columnaire et le réglage des requêtes à grande échelle.

  • Professionnels de la business intelligence dont les ensembles de données ont dépassé les bases de données relationnelles.

  • Ingénieurs cloud chargés de construire ou de migrer une infrastructure d'entrepôt de données.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en Côte d’Ivoire ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF