Choisissez votre langue
Formation Apache Hive : requêtes et optimisation
Plus de 2 millions d'apprenants dans le monde

Formation Apache Hive : requêtes et optimisation

Maîtrisez Apache Hive de A à Z — conception de schémas, rédaction de requêtes HiveQL puissantes et optimisation du rendement sur des ensembles de données massifs. Ce cours couvre tout, des fondements HDFS et des transactions ACID au déploiement en nuage, à la sécurité et à l'orchestration des flux de travail. Que vous construisiez des pipelines de données d'entreprise ou que vous optimisiez un data lakehouse, vous acquerrez les compétences pratiques qu'exigent les environnements de production.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Concevez des tables Hive gérées et externes avec le partitionnement, la segmentation et les formats de stockage en colonnes.

  • Rédigez des requêtes HiveQL avancées à l'aide de fonctions de fenêtrage, de CTE, de sous-requêtes et de jointures multi-tables.

  • Optimisez l'exécution des requêtes en appliquant l'élagage des partitions, la vectorisation et le réglage de l'optimiseur basé sur les coûts.

  • Implémentez la sécurité Hive à l'aide de l'authentification Kerberos, des politiques Apache Ranger et du masquage dynamique des données.

  • Intégrez Hive avec Apache Spark, le stockage d'objets en nuage et les formats de table ouverts comme Apache Iceberg.

  • Automatisez les pipelines de données avec Apache Airflow et Oozie, y compris le chargement incrémental et les contrôles de qualité.

Comment vous étudiez de façon pratique Formation Apache Hive : requêtes et optimisation

Comment vous pratiquez Formation Apache Hive : requêtes et optimisation

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Introduction au Big Data et à Hive

  • Leçon 1 • Architecture et composants de Hive

    Explique les composants principaux de Hive : le métastore, le pilote, le compilateur et le moteur d'exécution. Fait le lien entre l'architecture et la compréhension du cycle de vie des requêtes.

  • Leçon 2 • Fondamentaux et défis du Big Data

    Couvre les défis liés au volume, à la vélocité et à la variété qui motivent l'adoption du big data. Établit le contexte de l'existence d'outils de traitement distribué comme Hive.

  • Leçon 3 • Configuration d'un environnement Hive

    Guide l'installation et la configuration d'un environnement Hive local ou dans un bac à sable. Assure la préparation pratique pour tous les chapitres suivants.

  • Leçon 4 • Hive vs. bases de données traditionnelles

    Met en contraste le modèle de lecture sur schéma de Hive avec l'écriture sur schéma des SGBDR. Les étudiants comprennent quand Hive est approprié par rapport aux alternatives relationnelles.

Chapitre 2Voir les détails

Fondamentaux de HiveQL et types de données

  • Leçon 1 • Types de données primitifs et complexes

    Couvre les types primitifs numériques, chaîne, booléen et date, ainsi que les types complexes ARRAY, MAP et STRUCT. Un choix de type correct affecte le stockage et la précision des requêtes.

  • Leçon 2 • Syntaxe HiveQL et structure des requêtes

    Présente HiveQL comme un dialecte SQL avec des extensions propres à Hive. Couvre les clauses SELECT, FROM, WHERE et ORDER BY comme éléments de base.

  • Leçon 3 • Agrégation et regroupement

    Enseigne GROUP BY, HAVING et les fonctions d'agrégation pour résumer les ensembles de données. L'agrégation est fondamentale pour les modèles de requêtes analytiques utilisés tout au long du cours.

  • Leçon 4 • Sous-requêtes et expressions de table communes

    Introduit les vues en ligne, les sous-requêtes et les CTE avec la clause WITH pour une conception de requêtes modulaire. Ces modèles apparaissent dans les requêtes analytiques complexes des chapitres ultérieurs.

  • Leçon 5 • Fonctions et opérateurs intégrés

    Passe en revue les fonctions intégrées de chaîne, mathématiques, de date et conditionnelles. Les étudiants appliquent des fonctions pour transformer et évaluer des données dans les requêtes.

Chapitre 3Voir les détails

Conception de bases de données et de tables dans Hive

  • Leçon 1 • Partitionnement des tables

    Enseigne le partitionnement statique et dynamique pour réduire les analyses complètes de tables. Le partitionnement est la technique principale pour améliorer le rendement des requêtes sur les grandes tables.

  • Leçon 2 • Création et gestion de bases de données

    Couvre CREATE DATABASE, DROP DATABASE et les propriétés de base de données. Une organisation appropriée des bases de données soutient la gouvernance des données multi-équipes.

  • Leçon 3 • Formats de stockage de tables

    Compare les formats de stockage TextFile, SequenceFile, ORC et Parquet. Le choix du format a un impact direct sur la vitesse des requêtes et l'efficacité du stockage.

  • Leçon 4 • Tables gérées vs. tables externes

    Distingue les tables gérées (données appartenant à Hive) des tables externes (données appartenant à l'utilisateur). Un choix correct empêche la perte accidentelle de données.

  • Leçon 5 • Bucketing et clustering

    Introduit le bucketing comme complément au partitionnement pour une distribution uniforme des données. Les tables bucketées permettent un échantillonnage efficace et l'optimisation des jointures.

Chapitre 4Voir les détails

Chargement, insertion et gestion des données

  • Leçon 1 • Chargement de données à partir de fichiers

    Couvre LOAD DATA LOCAL et LOAD DATA à partir de chemins HDFS. Le chargement à partir de fichiers est le modèle d'ingestion initial le plus courant dans les flux de travail Hive.

  • Leçon 2 • Transactions ACID et opérations CRUD

    Explique la prise en charge ACID de Hive permettant UPDATE et DELETE sur les tables ORC. Les opérations ACID nécessitent une configuration et des propriétés de table spécifiques.

  • Leçon 3 • Modèles INSERT et INSERT OVERWRITE

    Enseigne INSERT INTO et INSERT OVERWRITE pour le peuplement de données basé sur des requêtes. Ces modèles soutiennent les pipelines ETL entièrement construits dans HiveQL.

  • Leçon 4 • Exportation et archivage de données

    Couvre INSERT OVERWRITE DIRECTORY et les commandes EXPORT/IMPORT. L'exportation de données soutient la consommation en aval et la migration entre clusters.

Chapitre 5Voir les détails

Jointures, unions et requêtes avancées

  • Leçon 1 • Jointures asymétriques et gestion de l'asymétrie des données

    Aborde l'asymétrie des jointures causée par des valeurs de clé à haute fréquence qui surchargent les réducteurs. L'optimisation des jointures asymétriques distribue les clés chaudes entre plusieurs tâches.

  • Leçon 2 • Types de jointures et syntaxe

    Couvre les jointures INNER, LEFT, RIGHT, FULL OUTER et CROSS avec la syntaxe HiveQL. Comprendre la sémantique des jointures empêche des ensembles de résultats incorrects.

  • Leçon 3 • UNION, INTERSECT et EXCEPT

    Enseigne les opérations ensemblistes pour combiner et comparer des ensembles de résultats entre requêtes. Ces opérations soutiennent les modèles de déduplication et d'analyse différentielle.

  • Leçon 4 • Jointures côté map et broadcast

    Explique les jointures côté map à l'aide de l'indice MAPJOIN pour l'optimisation des petites tables. Les jointures broadcast éliminent la surcharge de mélange dans les jointures grande table-petite table.

  • Leçon 5 • Fonctions de fenêtre et analytiques

    Introduit OVER, PARTITION BY et ORDER BY pour le classement et les agrégations courantes. Les fonctions de fenêtre permettent l'analyse avancée sans réduire la granularité des lignes.

Chapitre 6Voir les détails

Techniques d'optimisation des requêtes

  • Leçon 1 • Comprendre le plan d'exécution des requêtes

    Utilise EXPLAIN et EXPLAIN EXTENDED pour interpréter les plans d'exécution MapReduce et Tez. La lecture des plans est la compétence préalable à toutes les décisions d'optimisation.

  • Leçon 2 • Réglage du moteur d'exécution Tez

    Configure l'exécution DAG Tez pour une latence réduite par rapport à MapReduce. Tez est le moteur recommandé pour les charges de travail Hive interactives et itératives.

  • Leçon 3 • Élagage de partition et descente de prédicat

    Garantit que les requêtes ne parcourent que les partitions pertinentes et poussent les filtres le plus tôt possible. Ces techniques réduisent les E/S, qui sont le coût dominant dans les requêtes Hive.

  • Leçon 4 • Optimisation du format de fichier et de la compression

    Sélectionnez ORC et Parquet avec des codecs de compression appropriés pour minimiser le temps d'analyse. La compression réduit à la fois le coût de stockage et les E/S réseau pendant l'exécution des requêtes.

  • Leçon 5 • Vectorisation et optimiseur basé sur les coûts

    Active l'exécution vectorisée des requêtes et l'optimiseur basé sur les coûts (CBO) pour l'amélioration automatique des plans. Les deux nécessitent la collecte de statistiques pour fonctionner correctement.

Chapitre 7Voir les détails

Fonctions définies par l'utilisateur et extensibilité

  • Leçon 1 • Fonctions de table définies par l'utilisateur

    Construit des UDTF qui émettent plusieurs lignes à partir d'une seule ligne d'entrée à l'aide de l'interface UDTF. Les UDTF prennent en charge l'explosion de structures imbriquées et la génération de lignes personnalisées.

  • Leçon 2 • Fonctions d'agrégation définies par l'utilisateur

    Implémente les UDAF en utilisant les interfaces UDAF et GenericUDAF pour les agrégations personnalisées. Les UDAF fonctionnent sur les groupes de réducteurs et nécessitent une gestion de la mémoire tampon.

  • Leçon 3 • Fondamentaux du développement d'UDF

    Couvre la classe de base UDF, la méthode evaluate et l'empaquetage JAR pour les fonctions scalaires simples. Les UDF comblent les lacunes là où les fonctions intégrées sont insuffisantes.

  • Leçon 4 • Transformations basées sur Python et scripts

    Utilise TRANSFORM et les scripts de diffusion pour appliquer la logique Python ou shell dans HiveQL. Les transformations de script permettent un prototypage rapide sans compilation Java.

Chapitre 8Voir les détails

Hive en production : sécurité et gouvernance

  • Leçon 1 • Gestion du metastore et haute disponibilité

    Configure un metastore distant avec un backend relationnel et une configuration haute disponibilité. La fiabilité du metastore est essentielle pour un service Hive ininterrompu en production.

  • Leçon 2 • Modèles d'autorisation : normes SQL et Ranger

    Compare l'autorisation standard SQL de Hive avec le contrôle basé sur les politiques d'Apache Ranger. L'autorisation à granularité fine applique un accès de moindre privilège au niveau des colonnes.

  • Leçon 3 • Authentification et intégration Kerberos

    Configure l'authentification basée sur Kerberos pour HiveServer2 et les connexions client. L'authentification empêche l'accès non autorisé aux actifs de données sensibles.

  • Leçon 4 • Masquage des données et chiffrement

    Applique des politiques de masquage dynamique des données et des zones de chiffrement HDFS pour protéger les colonnes sensibles. Le masquage permet l'analyse de données sensibles sans exposer les valeurs brutes.

  • Leçon 5 • Vérification et journalisation de conformité

    Active les journaux de vérification des requêtes via HiveServer2 et les pistes de vérification Apache Ranger. Les journaux de vérification satisfont aux exigences réglementaires de conformité pour le suivi de l'accès aux données.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analystes de données prêts à développer leurs compétences au-delà des tableurs et du SQL.

  • Ingénieurs logiciels en transition vers des rôles en mégadonnées et systèmes distribués.

  • Développeurs ETL qui souhaitent moderniser leurs pipelines à l'aide d'outils basés sur Hadoop.

  • Administrateurs de base de données explorant le stockage en colonnes et l'optimisation à grande échelle des requêtes.

  • Professionnels de la veille stratégique dont les ensembles de données ont dépassé la capacité des bases de données relationnelles.

  • Ingénieurs en nuage chargés de construire ou de migrer une infrastructure d'entrepôt de données.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF