Choisissez votre langue
Formation Apache HBase pour le stockage Big Data
Plus de 2 millions d'étudiants dans le monde

Formation Apache HBase pour le stockage Big Data

Maîtrisez Apache HBase, des fondamentaux de l'architecture au déploiement, au réglage et à la réplication de niveau production. Cette formation donne aux ingénieurs de données et aux architectes les compétences pratiques nécessaires pour concevoir des solutions de stockage NoSQL évolutives pour les charges de travail réelles de big data. Allez au-delà de la théorie et développez l'expertise dont les équipes d'entreprise ont besoin.

Dedika pour les entreprises

Ce que vous allez apprendre:

  • Configurez des clusters HBase autonomes, pseudo-distribués et entièrement distribués à partir de zéro.

  • Concevez des clés de ligne et des schémas qui empêchent le hotspotting et prennent en charge des parcours de plage efficaces.

  • Implémentez des opérations CRUD, par lots et de parcours à l'aide de l'API Java client HBase.

  • Réglez le ramasse-miettes JVM, le BlockCache et les stratégies de compaction pour atteindre les objectifs de latence.

  • Configurez la réplication inter-cluster basée sur WAL et le basculement de haute disponibilité du HMaster.

  • Intégrez HBase avec Apache Spark, Hive, Kafka et Apache Phoenix pour des pipelines de bout en bout.

Comment vous étudiez de façon pratique Formation Apache HBase pour le stockage Big Data

Comment vous pratiquez Formation Apache HBase pour le stockage Big Data

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux d'HBase et Contexte du Big Data

  • Leçon 1 • HBase face aux autres systèmes NoSQL

    Compare HBase avec ses pairs de type document, clé-valeur et colonne large sur la cohérence, la latence et le débit. Guide les étudiants dans la sélection d'HBase pour des charges de travail appropriées.

  • Leçon 2 • Présentation de l'architecture HBase

    Introduit le modèle maître-serveur de région d'HBase et sa relation avec HDFS. Fournit le modèle mental structurel nécessaire pour tous les chapitres suivants.

  • Leçon 3 • Défis du stockage Big Data

    Examine les problèmes de volume, de vélocité et de variété que les bases de données relationnelles ne peuvent pas gérer. Pose la motivation pour les solutions NoSQL columnaires comme HBase.

  • Leçon 4 • Concepts du modèle de données HBase

    Définit les tables, les lignes, les familles de colonnes, les qualificatifs et les horodatages. Les étudiants mappent ces concepts à des cas d'utilisation réels pour construire une intuition avant le travail pratique.

Chapitre 2Voir les détails

Installation et configuration d'HBase

  • Leçon 1 • Configuration du mode pseudo-distribué

    Configure HBase pour utiliser HDFS sur une seule machine, simulant un cluster. Introduit les paramètres hbase-site.xml qui régissent le comportement distribué.

  • Leçon 2 • Installation en mode autonome

    Parcourt la configuration HBase sur un seul nœud pour le développement et les tests. Valide l'installation avec des commandes shell de base avant de passer aux modes distribués.

  • Leçon 3 • Prérequis environnementaux et planification

    Couvre les prérequis Java, Hadoop et OS avant toute étape d'installation. Évite les échecs de configuration courants en traitant les conflits de dépendances en amont.

  • Leçon 4 • Paramètres de configuration de base

    Ajuste hbase-site.xml, hbase-env.sh et les paramètres de tas JVM pour la stabilité. Relie les choix de configuration aux résultats de performance et de fiabilité.

  • Leçon 5 • Déploiement de cluster totalement distribué

    Déploie HBase sur plusieurs nœuds avec un quorum ZooKeeper et une réplication HDFS. Les étudiants configurent le fichier regionservers et testent la préparation au basculement.

Chapitre 3Voir les détails

Shell HBase et opérations de données de base

  • Leçon 1 • Mise à jour et suppression de données

    Explique le modèle d'écriture en ajout seul d'HBase et comment les suppressions utilisent des marqueurs de pierre tombale. Les étudiants pratiquent des modèles de suppression sécurisés pour éviter une perte de données involontaire.

  • Leçon 2 • Navigation dans le shell HBase

    Introduit les commandes shell, le système d'aide et les capacités de script. Établit des habitudes d'utilisation efficaces du shell avant d'effectuer des opérations sur les données.

  • Leçon 3 • Gestion des tables et des schémas

    Couvre les commandes create, alter, disable, enable et drop pour les tables. Enseigne les décisions de conception de schéma qui affectent l'efficacité du stockage et les performances des requêtes.

  • Leçon 4 • Chargement en masse de données

    Utilise les outils ImportTsv et completebulkload pour charger efficacement de grands ensembles de données. Évite les goulots d'étranglement du chemin d'écriture en générant directement des HFiles.

  • Leçon 5 • Écriture et lecture de données

    Montre les commandes put, get et scan avec des filtres et une gestion de versions. Relie les modèles de lecture/écriture au modèle de stockage LSM-tree sous-jacent.

Chapitre 4Voir les détails

Conception de clés de ligne et modélisation de schéma

  • Leçon 1 • Techniques de salage et de hachage

    Applique des préfixes de salage et des clés basées sur le hachage pour distribuer les écritures entre les régions. Les étudiants mesurent l'amélioration de la distribution à l'aide des métriques de charge du serveur de région.

  • Leçon 2 • Stratégies de conception de familles de colonnes

    Guide les décisions sur le nombre de familles de colonnes, la taille de bloc et la compression. Relie les paramètres au niveau de la famille au comportement MemStore et HFile.

  • Leçon 3 • Modèles de schéma pour les cas d'utilisation courants

    Applique des modèles de séries temporelles, de valeur-attribut-entité et d'index inversé à des scénarios réels. Les étudiants évaluent le coût de parcours et de stockage de chaque modèle.

  • Leçon 4 • Principes de conception de clés de ligne

    Explique comment la structure de la clé de ligne détermine la distribution des données et l'efficacité du parcours. Établit les règles fondamentales avant d'introduire des modèles de conception spécifiques.

  • Leçon 5 • Pré-division des régions à la création de la table

    Montre la pré-division manuelle et algorithmique des régions pour éviter les points chauds initiaux. Valide les limites de division par rapport à la distribution de clé attendue.

Chapitre 5Voir les détails

Architecture interne et moteur de stockage HBase

  • Leçon 1 • Types et politiques de compaction

    Distingue les compactions mineures et majeures et leur impact sur l'amplification de lecture et le stockage. Les étudiants configurent les politiques de compaction pour équilibrer les coûts d'écriture et de lecture.

  • Leçon 2 • Division et fusion de régions

    Explique les déclencheurs automatiques et manuels de division de région et la procédure de division. Couvre la fusion de régions pour consolider les petites régions et réduire la surcharge.

  • Leçon 3 • Configuration WAL et de durabilité

    Configure les modes de synchronisation WAL, le facteur de réplication et la compression WAL pour un équilibre entre durabilité et performance. Explique la récupération des données à partir du WAL après un plantage.

  • Leçon 4 • Chemin d'écriture et MemStore

    Trace une écriture client à travers le WAL, le MemStore et le vidage HFile éventuel. Explique les garanties de durabilité et les conditions de déclenchement du vidage.

  • Leçon 5 • Format HFile et cache de blocs

    Examine la structure HFile v2, y compris les blocs de données, les filtres Bloom et les blocs d'index. Relie la configuration du cache de blocs à la réduction de la latence de lecture.

Chapitre 6Voir les détails

API Java et programmation client HBase

  • Leçon 1 • Filtres et requêtes avancées

    Implémente des filtres côté serveur pour réduire le transfert réseau et le traitement côté client. Couvre la construction de filtres de ligne, de colonne, de valeur et composites.

  • Leçon 2 • API Scan et itération des résultats

    Utilise la classe Scan avec les lignes de début/fin, les filtres et les indications de mise en cache pour des lectures de plage efficaces. Enseigne le cycle de vie de ResultScanner et le nettoyage des ressources.

  • Leçon 3 • Configuration du client Java

    Configure les dépendances Maven ou Gradle et établit un objet Connection. Couvre le chargement de la configuration et la gestion du cycle de vie de la connexion.

  • Leçon 4 • Opérations par lots et de mutation

    Exécute des puts et des suppressions en masse à l'aide de Table.batch et BufferedMutator pour l'optimisation du débit. Gère les échecs partiels dans les tableaux de résultats par lots.

  • Leçon 5 • Opérations Put et Get en Java

    Implémente des écritures et des lectures de lignes uniques avec ciblage explicite de la famille de colonnes et du qualificatif. Introduit l'analyse des résultats et les modèles de null safety.

Chapitre 7Voir les détails

Ajustement des performances et surveillance HBase

  • Leçon 1 • Ajustement JVM et du ramasse-miettes

    Configure les paramètres G1GC et CMS pour réduire l'impact des pauses GC sur la latence du RegionServer. Relie le dimensionnement du tas à l'allocation MemStore et BlockCache.

  • Leçon 2 • Optimisation du chemin de lecture et d'écriture

    Ajuste la mise en cache des scans, les tailles de lots et les paramètres du tampon d'écriture pour maximiser le débit. Applique les paramètres côté client et côté serveur en combinaison.

  • Leçon 3 • Métriques HBase et surveillance JMX

    Collecte les métriques HBase via JMX, Hadoop metrics2 et les points de terminaison REST. Identifie les indicateurs clés pour la latence de lecture, la file d'attente de compaction et l'équilibre des régions.

  • Leçon 4 • Optimisation OS et réseau

    Ajuste les paramètres du noyau Linux, les ordonnanceurs d'E/S disque et les tampons réseau pour les charges de travail HBase. Empêche les goulots d'étranglement au niveau de l'OS de masquer les gains d'ajustement HBase.

  • Leçon 5 • Intégration avec les piles de surveillance

    Connecte les métriques HBase aux tableaux de bord Grafana via des exporteurs Prometheus ou Ganglia. Construit des règles d'alerte pour les seuils critiques comme la pause GC et le nombre de fichiers de magasin.

Chapitre 8Voir les détails

Haute disponibilité et réplication HBase

  • Leçon 1 • Tolérance aux pannes du RegionServer

    Explique la réaffectation des régions après une panne de RegionServer et la récupération basée sur WAL. Ajuste les paramètres de vitesse de récupération pour minimiser les fenêtres d'indisponibilité.

  • Leçon 2 • Architecture de réplication HBase

    Configure la réplication asynchrone basée sur WAL entre le cluster source et les clusters pairs. Explique la portée de la réplication, la gestion des pairs et la surveillance du décalage de réplication.

  • Leçon 3 • Haute disponibilité HMaster

    Déploie des instances HMaster de secours et configure l'élection du leader basée sur ZooKeeper. Teste le basculement automatique en simulant une panne du maître actif.

  • Leçon 4 • Gestion du quorum ZooKeeper

    Dimensionne et configure un ensemble ZooKeeper pour la fiabilité de la coordination HBase. Couvre l'ajustement du délai d'expiration de session et la gestion du répertoire de données ZooKeeper.

  • Leçon 5 • Sauvegarde, instantané et restauration

    Utilise les outils HBase snapshot et ExportSnapshot pour les sauvegardes ponctuelles sans temps d'arrêt. Pratique les procédures de restauration complète et incrémentielle pour valider la récupération.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Ingénieurs de données prêts à dépasser les bases de données relationnelles pour explorer le territoire NoSQL.

  • Développeurs backend construisant des systèmes devant gérer un débit d'écriture massif.

  • Administrateurs Hadoop souhaitant ajouter une expertise HBase à leur ensemble de compétences.

  • Architectes de solutions évaluant les magasins de colonnes larges pour les plateformes de données d'entreprise.

  • Ingénieurs logiciels en transition vers des rôles big data dans des entreprises axées sur les données.

  • Professionnels DevOps chargés de déployer et de maintenir des clusters de stockage distribués.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail des cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF