
Formation Apache Hive : requêtes et optimisation
Maîtrisez Apache Hive de A à Z — conception de schémas, rédaction de requêtes HiveQL puissantes et optimisation du rendement sur des ensembles de données massifs. Ce cours couvre tout, des fondements HDFS et des transactions ACID au déploiement en nuage, à la sécurité et à l'orchestration des flux de travail. Que vous construisiez des pipelines de données d'entreprise ou que vous optimisiez un data lakehouse, vous acquerrez les compétences pratiques qu'exigent les environnements de production.
Ce que vous allez apprendre:
Concevez des tables Hive gérées et externes avec le partitionnement, la segmentation et les formats de stockage en colonnes.
Rédigez des requêtes HiveQL avancées à l'aide de fonctions de fenêtrage, de CTE, de sous-requêtes et de jointures multi-tables.
Optimisez l'exécution des requêtes en appliquant l'élagage des partitions, la vectorisation et le réglage de l'optimiseur basé sur les coûts.
Implémentez la sécurité Hive à l'aide de l'authentification Kerberos, des politiques Apache Ranger et du masquage dynamique des données.
Intégrez Hive avec Apache Spark, le stockage d'objets en nuage et les formats de table ouverts comme Apache Iceberg.
Automatisez les pipelines de données avec Apache Airflow et Oozie, y compris le chargement incrémental et les contrôles de qualité.
Comment vous étudiez de façon pratique Formation Apache Hive : requêtes et optimisation
Comment vous pratiquez Formation Apache Hive : requêtes et optimisation
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsIntroduction au Big Data et à Hive
Introduction au Big Data et à Hive
Leçon 1 • Architecture et composants de Hive
Explique les composants principaux de Hive : le métastore, le pilote, le compilateur et le moteur d'exécution. Fait le lien entre l'architecture et la compréhension du cycle de vie des requêtes.
Leçon 2 • Fondamentaux et défis du Big Data
Couvre les défis liés au volume, à la vélocité et à la variété qui motivent l'adoption du big data. Établit le contexte de l'existence d'outils de traitement distribué comme Hive.
Leçon 3 • Configuration d'un environnement Hive
Guide l'installation et la configuration d'un environnement Hive local ou dans un bac à sable. Assure la préparation pratique pour tous les chapitres suivants.
Leçon 4 • Hive vs. bases de données traditionnelles
Met en contraste le modèle de lecture sur schéma de Hive avec l'écriture sur schéma des SGBDR. Les étudiants comprennent quand Hive est approprié par rapport aux alternatives relationnelles.
Chapitre 2MasquerCacher les détailsVoir les détailsFondamentaux de HiveQL et types de données
Fondamentaux de HiveQL et types de données
Leçon 1 • Types de données primitifs et complexes
Couvre les types primitifs numériques, chaîne, booléen et date, ainsi que les types complexes ARRAY, MAP et STRUCT. Un choix de type correct affecte le stockage et la précision des requêtes.
Leçon 2 • Syntaxe HiveQL et structure des requêtes
Présente HiveQL comme un dialecte SQL avec des extensions propres à Hive. Couvre les clauses SELECT, FROM, WHERE et ORDER BY comme éléments de base.
Leçon 3 • Agrégation et regroupement
Enseigne GROUP BY, HAVING et les fonctions d'agrégation pour résumer les ensembles de données. L'agrégation est fondamentale pour les modèles de requêtes analytiques utilisés tout au long du cours.
Leçon 4 • Sous-requêtes et expressions de table communes
Introduit les vues en ligne, les sous-requêtes et les CTE avec la clause WITH pour une conception de requêtes modulaire. Ces modèles apparaissent dans les requêtes analytiques complexes des chapitres ultérieurs.
Leçon 5 • Fonctions et opérateurs intégrés
Passe en revue les fonctions intégrées de chaîne, mathématiques, de date et conditionnelles. Les étudiants appliquent des fonctions pour transformer et évaluer des données dans les requêtes.
Chapitre 3MasquerCacher les détailsVoir les détailsConception de bases de données et de tables dans Hive
Conception de bases de données et de tables dans Hive
Leçon 1 • Partitionnement des tables
Enseigne le partitionnement statique et dynamique pour réduire les analyses complètes de tables. Le partitionnement est la technique principale pour améliorer le rendement des requêtes sur les grandes tables.
Leçon 2 • Création et gestion de bases de données
Couvre CREATE DATABASE, DROP DATABASE et les propriétés de base de données. Une organisation appropriée des bases de données soutient la gouvernance des données multi-équipes.
Leçon 3 • Formats de stockage de tables
Compare les formats de stockage TextFile, SequenceFile, ORC et Parquet. Le choix du format a un impact direct sur la vitesse des requêtes et l'efficacité du stockage.
Leçon 4 • Tables gérées vs. tables externes
Distingue les tables gérées (données appartenant à Hive) des tables externes (données appartenant à l'utilisateur). Un choix correct empêche la perte accidentelle de données.
Leçon 5 • Bucketing et clustering
Introduit le bucketing comme complément au partitionnement pour une distribution uniforme des données. Les tables bucketées permettent un échantillonnage efficace et l'optimisation des jointures.
Chapitre 4MasquerCacher les détailsVoir les détailsChargement, insertion et gestion des données
Chargement, insertion et gestion des données
Leçon 1 • Chargement de données à partir de fichiers
Couvre LOAD DATA LOCAL et LOAD DATA à partir de chemins HDFS. Le chargement à partir de fichiers est le modèle d'ingestion initial le plus courant dans les flux de travail Hive.
Leçon 2 • Transactions ACID et opérations CRUD
Explique la prise en charge ACID de Hive permettant UPDATE et DELETE sur les tables ORC. Les opérations ACID nécessitent une configuration et des propriétés de table spécifiques.
Leçon 3 • Modèles INSERT et INSERT OVERWRITE
Enseigne INSERT INTO et INSERT OVERWRITE pour le peuplement de données basé sur des requêtes. Ces modèles soutiennent les pipelines ETL entièrement construits dans HiveQL.
Leçon 4 • Exportation et archivage de données
Couvre INSERT OVERWRITE DIRECTORY et les commandes EXPORT/IMPORT. L'exportation de données soutient la consommation en aval et la migration entre clusters.
Chapitre 5MasquerCacher les détailsVoir les détailsJointures, unions et requêtes avancées
Jointures, unions et requêtes avancées
Leçon 1 • Jointures asymétriques et gestion de l'asymétrie des données
Aborde l'asymétrie des jointures causée par des valeurs de clé à haute fréquence qui surchargent les réducteurs. L'optimisation des jointures asymétriques distribue les clés chaudes entre plusieurs tâches.
Leçon 2 • Types de jointures et syntaxe
Couvre les jointures INNER, LEFT, RIGHT, FULL OUTER et CROSS avec la syntaxe HiveQL. Comprendre la sémantique des jointures empêche des ensembles de résultats incorrects.
Leçon 3 • UNION, INTERSECT et EXCEPT
Enseigne les opérations ensemblistes pour combiner et comparer des ensembles de résultats entre requêtes. Ces opérations soutiennent les modèles de déduplication et d'analyse différentielle.
Leçon 4 • Jointures côté map et broadcast
Explique les jointures côté map à l'aide de l'indice MAPJOIN pour l'optimisation des petites tables. Les jointures broadcast éliminent la surcharge de mélange dans les jointures grande table-petite table.
Leçon 5 • Fonctions de fenêtre et analytiques
Introduit OVER, PARTITION BY et ORDER BY pour le classement et les agrégations courantes. Les fonctions de fenêtre permettent l'analyse avancée sans réduire la granularité des lignes.
Chapitre 6MasquerCacher les détailsVoir les détailsTechniques d'optimisation des requêtes
Techniques d'optimisation des requêtes
Leçon 1 • Comprendre le plan d'exécution des requêtes
Utilise EXPLAIN et EXPLAIN EXTENDED pour interpréter les plans d'exécution MapReduce et Tez. La lecture des plans est la compétence préalable à toutes les décisions d'optimisation.
Leçon 2 • Réglage du moteur d'exécution Tez
Configure l'exécution DAG Tez pour une latence réduite par rapport à MapReduce. Tez est le moteur recommandé pour les charges de travail Hive interactives et itératives.
Leçon 3 • Élagage de partition et descente de prédicat
Garantit que les requêtes ne parcourent que les partitions pertinentes et poussent les filtres le plus tôt possible. Ces techniques réduisent les E/S, qui sont le coût dominant dans les requêtes Hive.
Leçon 4 • Optimisation du format de fichier et de la compression
Sélectionnez ORC et Parquet avec des codecs de compression appropriés pour minimiser le temps d'analyse. La compression réduit à la fois le coût de stockage et les E/S réseau pendant l'exécution des requêtes.
Leçon 5 • Vectorisation et optimiseur basé sur les coûts
Active l'exécution vectorisée des requêtes et l'optimiseur basé sur les coûts (CBO) pour l'amélioration automatique des plans. Les deux nécessitent la collecte de statistiques pour fonctionner correctement.
Chapitre 7MasquerCacher les détailsVoir les détailsFonctions définies par l'utilisateur et extensibilité
Fonctions définies par l'utilisateur et extensibilité
Leçon 1 • Fonctions de table définies par l'utilisateur
Construit des UDTF qui émettent plusieurs lignes à partir d'une seule ligne d'entrée à l'aide de l'interface UDTF. Les UDTF prennent en charge l'explosion de structures imbriquées et la génération de lignes personnalisées.
Leçon 2 • Fonctions d'agrégation définies par l'utilisateur
Implémente les UDAF en utilisant les interfaces UDAF et GenericUDAF pour les agrégations personnalisées. Les UDAF fonctionnent sur les groupes de réducteurs et nécessitent une gestion de la mémoire tampon.
Leçon 3 • Fondamentaux du développement d'UDF
Couvre la classe de base UDF, la méthode evaluate et l'empaquetage JAR pour les fonctions scalaires simples. Les UDF comblent les lacunes là où les fonctions intégrées sont insuffisantes.
Leçon 4 • Transformations basées sur Python et scripts
Utilise TRANSFORM et les scripts de diffusion pour appliquer la logique Python ou shell dans HiveQL. Les transformations de script permettent un prototypage rapide sans compilation Java.
Chapitre 8MasquerCacher les détailsVoir les détailsHive en production : sécurité et gouvernance
Hive en production : sécurité et gouvernance
Leçon 1 • Gestion du metastore et haute disponibilité
Configure un metastore distant avec un backend relationnel et une configuration haute disponibilité. La fiabilité du metastore est essentielle pour un service Hive ininterrompu en production.
Leçon 2 • Modèles d'autorisation : normes SQL et Ranger
Compare l'autorisation standard SQL de Hive avec le contrôle basé sur les politiques d'Apache Ranger. L'autorisation à granularité fine applique un accès de moindre privilège au niveau des colonnes.
Leçon 3 • Authentification et intégration Kerberos
Configure l'authentification basée sur Kerberos pour HiveServer2 et les connexions client. L'authentification empêche l'accès non autorisé aux actifs de données sensibles.
Leçon 4 • Masquage des données et chiffrement
Applique des politiques de masquage dynamique des données et des zones de chiffrement HDFS pour protéger les colonnes sensibles. Le masquage permet l'analyse de données sensibles sans exposer les valeurs brutes.
Leçon 5 • Vérification et journalisation de conformité
Active les journaux de vérification des requêtes via HiveServer2 et les pistes de vérification Apache Ranger. Les journaux de vérification satisfont aux exigences réglementaires de conformité pour le suivi de l'accès aux données.
Votre certificat valide de réussite
Ce cours est pour vous :
Analystes de données prêts à développer leurs compétences au-delà des tableurs et du SQL.
Ingénieurs logiciels en transition vers des rôles en mégadonnées et systèmes distribués.
Développeurs ETL qui souhaitent moderniser leurs pipelines à l'aide d'outils basés sur Hadoop.
Administrateurs de base de données explorant le stockage en colonnes et l'optimisation à grande échelle des requêtes.
Professionnels de la veille stratégique dont les ensembles de données ont dépassé la capacité des bases de données relationnelles.
Ingénieurs en nuage chargés de construire ou de migrer une infrastructure d'entrepôt de données.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















