
Apache Hive: Design, Query, and Optimize Big Data Course
Maîtrisez Apache Hive de A à Z — conception de schémas, rédaction de requêtes HiveQL puissantes et réglage des performances sur des ensembles de données massifs. Ce cours couvre tout, des fondamentaux HDFS et des transactions ACID au déploiement dans le nuage, à la sécurité et à l'orchestration des workflows. Que vous construisiez des pipelines de données d'entreprise ou optimisiez un lakehouse de données, vous acquerrez les compétences pratiques qu'exigent les environnements de production.
Ce que votre équipe va maîtriser:
Concevez des tables Hive gérées et externes avec partitionnement, regroupement et formats de stockage columnaires.
Écrivez des requêtes HiveQL avancées en utilisant des fonctions de fenêtre, des CTE, des sous-requêtes et des jointures multi-tables.
Optimisez l'exécution des requêtes en appliquant l'élagage de partitions, la vectorisation et le réglage de l'optimiseur basé sur les coûts.
Implémentez la sécurité Hive à l'aide de l'authentification Kerberos, des politiques Apache Ranger et du masquage dynamique des données.
Intégrez Hive avec Apache Spark, le stockage d'objets dans le nuage et les formats de table ouverts comme Apache Iceberg.
Automatisez les pipelines de données avec Apache Airflow et Oozie, y compris le chargement incrémental et les contrôles de qualité.
Comment votre équipe apprend de façon pratique Apache Hive: Design, Query, and Optimize Big Data Course
Comment votre équipe pratique Apache Hive: Design, Query, and Optimize Big Data Course
Des professionnels de ces entreprises apprennent sur Dedika









Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsIntroduction au Big Data et à Hive
Introduction au Big Data et à Hive
Leçon 1 • Architecture et Composants de Hive
Explique les composants principaux de Hive : metastore, pilote, compilateur et moteur d'exécution. Relie l'architecture à la compréhension du cycle de vie d'une requête.
Leçon 2 • Fondamentaux et Défis du Big Data
Couvre les défis de volume, vélocité et variété qui motivent l'adoption du big data. Établit le contexte de l'existence d'outils de traitement distribué comme Hive.
Leçon 3 • Installation d'un Environnement Hive
Guide l'installation et la configuration d'un environnement Hive local ou sandbox. Fournit une préparation pratique pour tous les chapitres suivants.
Leçon 4 • Hive vs Bases de Données Traditionnelles
Compare le modèle schema-on-read de Hive au schema-on-write des RDBMS. Les étudiants comprennent quand Hive est approprié par rapport aux alternatives relationnelles.
Chapitre 2MasquerCacher les détailsVoir les détailsFondamentaux de HiveQL et Types de Données
Fondamentaux de HiveQL et Types de Données
Leçon 1 • Types de Données Primitifs et Complexes
Couvre les primitives numériques, chaînes, booléennes et date, ainsi que les types complexes ARRAY, MAP et STRUCT. Le choix correct du type affecte le stockage et la précision des requêtes.
Leçon 2 • Syntaxe HiveQL et Structure des Requêtes
Introduit HiveQL comme un dialecte SQL avec des extensions spécifiques à Hive. Couvre les clauses SELECT, FROM, WHERE et ORDER BY comme éléments de base.
Leçon 3 • Agrégation et Regroupement
Enseigne GROUP BY, HAVING et les fonctions d'agrégation pour résumer les ensembles de données. L'agrégation est fondamentale pour les modèles de requêtes analytiques utilisés tout au long du cours.
Leçon 4 • Sous-requêtes et Expressions de Table Communes
Introduit les vues en ligne, les sous-requêtes et les CTE avec la clause WITH pour une conception de requêtes modulaire. Ces modèles apparaissent dans les requêtes analytiques complexes des chapitres suivants.
Leçon 5 • Fonctions et Opérateurs Intégrés
Passe en revue les fonctions intégrées de chaîne, mathématiques, de date et conditionnelles. Les étudiants appliquent des fonctions pour transformer et évaluer des données dans les requêtes.
Chapitre 3MasquerCacher les détailsVoir les détailsConception de Bases de Données et de Tables dans Hive
Conception de Bases de Données et de Tables dans Hive
Leçon 1 • Partitionnement des Tables
Enseigne le partitionnement statique et dynamique pour réduire les analyses de tables complètes. Le partitionnement est la principale technique pour améliorer les performances des requêtes sur de grandes tables.
Leçon 2 • Création et Gestion des Bases de Données
Couvre CREATE DATABASE, DROP DATABASE et les propriétés des bases de données. Une organisation appropriée des bases de données soutient la gouvernance des données multi-équipe.
Leçon 3 • Formats de Stockage des Tables
Compare les formats de stockage TextFile, SequenceFile, ORC et Parquet. Le choix du format a un impact direct sur la vitesse des requêtes et l'efficacité du stockage.
Leçon 4 • Tables Gérées vs Externes
Distingue les tables gérées (données détenues par Hive) des tables externes (données détenues par l'utilisateur). Un choix correct empêche la perte accidentelle de données.
Leçon 5 • Bucketing et Clustering
Introduit le bucketing comme complément au partitionnement pour une distribution uniforme des données. Les tables buckétées permettent un échantillonnage efficace et une optimisation des jointures.
Chapitre 4MasquerCacher les détailsVoir les détailsChargement, Insertion et Gestion des Données
Chargement, Insertion et Gestion des Données
Leçon 1 • Chargement de Données à partir de Fichiers
Couvre LOAD DATA LOCAL et LOAD DATA à partir de chemins HDFS. Le chargement basé sur les fichiers est le modèle d'ingestion initial le plus courant dans les workflows Hive.
Leçon 2 • Transactions ACID et Opérations CRUD
Explique le support ACID de Hive permettant UPDATE et DELETE sur les tables ORC. Les opérations ACID nécessitent une configuration et des propriétés de table spécifiques.
Leçon 3 • Modèles INSERT et INSERT OVERWRITE
Enseigne INSERT INTO et INSERT OVERWRITE pour le peuplement de données piloté par requête. Ces modèles soutiennent les pipelines ETL construits entièrement dans HiveQL.
Leçon 4 • Exportation et Archivage de Données
Couvre INSERT OVERWRITE DIRECTORY et les commandes EXPORT/IMPORT. L'exportation de données prend en charge la consommation en aval et la migration entre clusters.
Chapitre 5MasquerCacher les détailsVoir les détailsJointures, Unions et Requêtes Avancées
Jointures, Unions et Requêtes Avancées
Leçon 1 • Jointures Skew et Gestion de la Skew de Données
Aborde la skew de jointure causée par des valeurs de clé à haute fréquence qui surchargent les réducteurs. L'optimisation des jointures skew distribue les clés chaudes entre plusieurs tâches.
Leçon 2 • Types de Jointures et Syntaxe
Couvre les jointures INNER, LEFT, RIGHT, FULL OUTER et CROSS avec la syntaxe HiveQL. La compréhension de la sémantique des jointures empêche des ensembles de résultats incorrects.
Leçon 3 • UNION, INTERSECT et EXCEPT
Enseigne les opérations d'ensemble pour combiner et comparer des ensembles de résultats entre requêtes. Ces opérations prennent en charge la déduplication et les modèles d'analyse différentielle.
Leçon 4 • Jointures Map-Side et Broadcast
Explique les jointures map-side utilisant l'indication MAPJOIN pour l'optimisation des petites tables. Les jointures broadcast éliminent la surcharge de shuffle dans les jointures grande table vers petite table.
Leçon 5 • Fonctions de Fenêtrage et Analytiques
Introduit OVER, PARTITION BY et ORDER BY pour le classement et les agrégations courantes. Les fonctions de fenêtrage permettent des analyses avancées sans réduire la granularité des lignes.
Chapitre 6MasquerCacher les détailsVoir les détailsTechniques d'Optimisation des Requêtes
Techniques d'Optimisation des Requêtes
Leçon 1 • Compréhension du Plan d'Exécution des Requêtes
Utilise EXPLAIN et EXPLAIN EXTENDED pour interpréter les plans d'exécution MapReduce et Tez. La lecture des plans est la compétence prérequise pour toutes les décisions d'optimisation.
Leçon 2 • Réglage du Moteur d'Exécution Tez
Configure l'exécution DAG de Tez pour une latence réduite par rapport à MapReduce. Tez est le moteur recommandé pour les charges de travail Hive interactives et itératives.
Leçon 3 • Élagage des Partitions et Pushdown de Prédicats
Garantit que les requêtes ne parcourent que les partitions pertinentes et poussent les filtres le plus tôt possible. Ces techniques réduisent les E/S, qui sont le coût dominant dans les requêtes Hive.
Leçon 4 • Optimisation du Format de Fichier et de la Compression
Sélectionnez ORC et Parquet avec des codecs de compression appropriés pour minimiser le temps de lecture. La compression réduit à la fois le coût de stockage et les E/S réseau pendant l'exécution des requêtes.
Leçon 5 • Vectorisation et Optimiseur Basé sur les Coûts
Active l'exécution vectorisée des requêtes et l'optimiseur basé sur les coûts (CBO) pour l'amélioration automatique des plans. Les deux nécessitent la collecte de statistiques pour fonctionner correctement.
Chapitre 7MasquerCacher les détailsVoir les détailsFonctions Définies par l'Utilisateur et Extensibilité
Fonctions Définies par l'Utilisateur et Extensibilité
Leçon 1 • Fonctions de Table Définies par l'Utilisateur
Construit des UDTF qui émettent plusieurs lignes à partir d'une seule ligne d'entrée en utilisant l'interface UDTF. Les UDTF prennent en charge l'explosion de structures imbriquées et la génération personnalisée de lignes.
Leçon 2 • Fonctions d'Agrégation Définies par l'Utilisateur
Implémente les UDAF en utilisant les interfaces UDAF et GenericUDAF pour des agrégations personnalisées. Les UDAF opèrent sur les groupes de réducteurs et nécessitent une gestion de la mémoire tampon.
Leçon 3 • Fondamentaux du Développement d'UDF
Couvre la classe de base UDF, la méthode evaluate et le packaging JAR pour des fonctions scalaires simples. Les UDF comblent les lacunes là où les fonctions intégrées sont insuffisantes.
Leçon 4 • Transformations Python et Basées sur des Scripts
Utilise TRANSFORM et les scripts de streaming pour appliquer une logique Python ou shell dans HiveQL. Les transformations de script permettent un prototypage rapide sans compilation Java.
Chapitre 8MasquerCacher les détailsVoir les détailsHive en Production : Sécurité et Gouvernance
Hive en Production : Sécurité et Gouvernance
Leçon 1 • Gestion du Metastore et Haute Disponibilité
Configure un metastore distant avec un backend relationnel et une configuration haute disponibilité. La fiabilité du metastore est critique pour un service Hive ininterrompu en production.
Leçon 2 • Modèles d'Autorisation : Normes SQL et Ranger
Compare l'autorisation standard SQL de Hive avec le contrôle basé sur les politiques d'Apache Ranger. L'autorisation à granularité fine applique un accès de moindre privilège au niveau des colonnes.
Leçon 3 • Authentification et Intégration Kerberos
Configure l'authentification basée sur Kerberos pour HiveServer2 et les connexions client. L'authentification empêche l'accès non autorisé aux actifs de données sensibles.
Leçon 4 • Masquage de Données et Chiffrement
Applique des politiques de masquage dynamique de données et des zones de chiffrement HDFS pour protéger les colonnes sensibles. Le masquage permet l'analyse de données sensibles sans exposer les valeurs brutes.
Leçon 5 • Audit et Journalisation de Conformité
Active les journaux d'audit des requêtes via HiveServer2 et les pistes d'audit d'Apache Ranger. Les journaux d'audit satisfont aux exigences de conformité réglementaire pour le suivi de l'accès aux données.
Votre certificat valide de réussite
Ce cours est pour vous :
Analystes de données prêts à développer leurs compétences au-delà des tableurs et du SQL.
Ingénieurs logiciels en transition vers les rôles liés aux big data et aux systèmes distribués.
Développeurs ETL qui souhaitent moderniser les pipelines à l'aide d'outils basés sur Hadoop.
Administrateurs de bases de données explorant le stockage columnaire et le réglage des requêtes à grande échelle.
Professionnels de la business intelligence dont les ensembles de données ont dépassé les bases de données relationnelles.
Ingénieurs cloud chargés de construire ou de migrer une infrastructure d'entrepôt de données.
Cours associés
FAQ
Qui est Dedika ?
Le certificat est-il valable en Côte d’Ivoire ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF



















