Choisissez votre langue
Formation Apache HBase pour le stockage Big Data
Plus de 2 millions d'apprenants dans le monde

Formation Apache HBase pour le stockage Big Data

Maîtrisez Apache HBase, des fondamentaux de l'architecture logicielle jusqu'au déploiement, au réglage et à la réplication de niveau production. Cette formation dote les ingénieurs de données et les architectes des compétences pratiques nécessaires pour concevoir des solutions de stockage NoSQL évolutives pour de véritables charges de travail big data. Allez au-delà de la théorie et développez l'expertise sur laquelle les équipes en entreprise comptent.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Configurez des clusters HBase autonomes, pseudo-distribués et entièrement distribués à partir de zéro.

  • Concevez des clés de ligne et des schémas qui empêchent le hotspotting et prennent en charge des analyses par plage efficaces.

  • Mettez en œuvre des opérations CRUD, par lots et d'analyse à l'aide de l'API Java client HBase.

  • Ajustez le ramasse-miettes JVM, le BlockCache et les politiques de compaction pour atteindre les objectifs de latence.

  • Configurez la réplication inter-clusters basée sur WAL et le basculement haute disponibilité HMaster.

  • Intégrez HBase avec Apache Spark, Hive, Kafka et Apache Phoenix pour des pipelines de bout en bout.

Comment vous étudiez de façon pratique Formation Apache HBase pour le stockage Big Data

Comment vous pratiquez Formation Apache HBase pour le stockage Big Data

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements HBase et Contexte Big Data

  • Leçon 1 • HBase contre les autres magasins NoSQL

    Compare HBase avec les pairs document, clé-valeur et large colonne sur la cohérence, la latence et le débit. Guide les étudiants dans la sélection de HBase pour les charges de travail appropriées.

  • Leçon 2 • Aperçu de l'architecture HBase

    Présente le modèle maître-serveur de région de HBase et sa relation avec HDFS. Fournit le modèle mental structurel nécessaire pour tous les chapitres suivants.

  • Leçon 3 • Défis du stockage Big Data

    Examine les problèmes de volume, de vélocité et de variété que les bases de données relationnelles ne peuvent pas gérer. Pose la motivation pour les solutions NoSQL columnaires comme HBase.

  • Leçon 4 • Concepts du modèle de données HBase

    Définit les tables, les lignes, les familles de colonnes, les qualificatifs et les horodatages. Les étudiants mappent ces concepts à des cas d'utilisation réels pour construire l'intuition avant le travail pratique.

Chapitre 2Voir les détails

Installation et configuration de HBase

  • Leçon 1 • Configuration du mode pseudo-distribué

    Configure HBase pour utiliser HDFS sur une seule machine, simulant un cluster. Introduit les paramètres hbase-site.xml qui régissent le comportement distribué.

  • Leçon 2 • Installation en mode autonome

    Guide l'installation HBase sur un nœud unique pour le développement et les tests. Valide l'installation avec des commandes shell de base avant de passer aux modes distribués.

  • Leçon 3 • Prérequis d'environnement et planification

    Couvre les exigences Java, Hadoop et OS avant toute étape d'installation. Évite les échecs de configuration courants en traitant les conflits de dépendances en amont.

  • Leçon 4 • Paramètres de configuration de base

    Ajuste les paramètres hbase-site.xml, hbase-env.sh et JVM heap pour la stabilité. Relie les choix de configuration aux résultats de performance et de fiabilité.

  • Leçon 5 • Déploiement de cluster entièrement distribué

    Déploie HBase sur plusieurs nœuds avec un quorum ZooKeeper et une réplication HDFS. Les étudiants configurent le fichier regionservers et testent la préparation au basculement.

Chapitre 3Voir les détails

Shell HBase et opérations de données de base

  • Leçon 1 • Mise à jour et suppression de données

    Explique le modèle d'écriture append-only de HBase et comment les suppressions utilisent des marqueurs de tombe. Les étudiants pratiquent des modèles de suppression sécurisés pour éviter une perte de données involontaire.

  • Leçon 2 • Navigation dans le shell HBase

    Introduit les commandes shell, le système d'aide et les capacités de script. Établit des habitudes d'utilisation efficaces du shell avant d'effectuer des opérations sur les données.

  • Leçon 3 • Gestion des tables et des schémas

    Couvre les commandes create, alter, disable, enable, et drop pour les tables. Enseigne les décisions de conception de schéma qui affectent l'efficacité du stockage et les performances des requêtes.

  • Leçon 4 • Chargement en masse de données

    Utilise les outils ImportTsv et completebulkload pour charger efficacement de grands ensembles de données. Évite les goulots d'étranglement du chemin d'écriture en générant des HFiles directement.

  • Leçon 5 • Écriture et lecture de données

    Démontre les commandes put, get et scan avec des filtres et le contrôle de version. Relie les modèles de lecture/écriture au modèle de stockage sous-jacent LSM-tree.

Chapitre 4Voir les détails

Conception de clé de ligne et modélisation de schéma

  • Leçon 1 • Techniques de salage et de hachage

    Applique les préfixes de salage et les clés basées sur le hachage pour distribuer les écritures entre les régions. Les étudiants mesurent l'amélioration de la distribution à l'aide des métriques de charge du serveur de région.

  • Leçon 2 • Stratégies de conception de familles de colonnes

    Guide les décisions sur le nombre de familles de colonnes, la taille de bloc et la compression. Relie les paramètres au niveau de la famille au comportement MemStore et HFile.

  • Leçon 3 • Modèles de schéma pour les cas d'utilisation courants

    Applique les modèles de séries temporelles, entité-attribut-valeur et index inversé à des scénarios réels. Les étudiants évaluent le coût de scan et de stockage de chaque modèle.

  • Leçon 4 • Principes de conception de clé de ligne

    Explique comment la structure de la clé de ligne détermine la distribution des données et l'efficacité du scan. Établit les règles fondamentales avant d'introduire des modèles de conception spécifiques.

  • Leçon 5 • Pré-découpage des régions à la création de table

    Démontre le pré-découpage manuel et algorithmique des régions pour éviter les hotspots initiaux. Valide les limites de découpage par rapport à la distribution de clés attendue.

Chapitre 5Voir les détails

Internes HBase et moteur de stockage

  • Leçon 1 • Types et politiques de compactage

    Distingue les compactages mineurs et majeurs et leur impact sur l'amplification de lecture et le stockage. Les étudiants configurent les politiques de compactage pour équilibrer les coûts d'écriture et de lecture.

  • Leçon 2 • Découpage et fusion de régions

    Explique les déclencheurs de découpage automatique et manuel des régions et la procédure de découpage. Couvre la fusion de régions pour consolider les petites régions et réduire la surcharge.

  • Leçon 3 • Configuration WAL et durabilité

    Configure les modes de synchronisation WAL, le facteur de réplication et la compression WAL pour équilibrer durabilité et performance. Explique la récupération des données à partir du WAL après un crash.

  • Leçon 4 • Chemin d'écriture et MemStore

    Trace une écriture client à travers le WAL, le MemStore, et le vidage éventuel du HFile. Explique les garanties de durabilité et les conditions de déclenchement du vidage.

  • Leçon 5 • Format HFile et cache de blocs

    Examine la structure HFile v2, y compris les blocs de données, les filtres bloom et les blocs d'index. Relie la configuration du cache de blocs à la réduction de la latence de lecture.

Chapitre 6Voir les détails

API Java HBase et programmation client

  • Leçon 1 • Filtres et requêtes avancées

    Implémente des filtres côté serveur pour réduire le transfert réseau et le traitement côté client. Couvre la construction de filtres de ligne, de colonne, de valeur et composite.

  • Leçon 2 • API Scan et itération des résultats

    Utilise la classe Scan avec les lignes de début/fin, les filtres et les indications de mise en cache pour les lectures efficaces de plage. Enseigne le cycle de vie de ResultScanner et le nettoyage des ressources.

  • Leçon 3 • Configuration du client Java

    Configure les dépendances Maven ou Gradle et établit un objet Connection. Couvre le chargement de la configuration et la gestion du cycle de vie de la connexion.

  • Leçon 4 • Opérations par lots et Mutate

    Exécute des puts et deletes en masse à l'aide de Table.batch et BufferedMutator pour l'optimisation du débit. Gère les échecs partiels dans les tableaux de résultats batch.

  • Leçon 5 • Opérations Put et Get en Java

    Implémente les écritures et lectures de lignes uniques avec un ciblage explicite de la famille de colonnes et du qualificatif. Introduit l'analyse des résultats et les modèles de sécurité null.

Chapitre 7Voir les détails

Ajustement des performances et surveillance HBase

  • Leçon 1 • Ajustement JVM et garbage collection

    Configure les paramètres G1GC et CMS pour réduire l'impact des pauses GC sur la latence du RegionServer. Relie le dimensionnement du tas à l'allocation MemStore et BlockCache.

  • Leçon 2 • Optimisation du chemin de lecture et d'écriture

    Ajuste la mise en cache des scans, les tailles de lots et les paramètres du tampon d'écriture pour maximiser le débit. Applique les paramètres côté client et côté serveur en combinaison.

  • Leçon 3 • Métriques HBase et surveillance JMX

    Collecte les métriques HBase via JMX, Hadoop metrics2 et les endpoints REST. Identifie les indicateurs clés pour la latence de lecture, la file d'attente de compactage et l'équilibre des régions.

  • Leçon 4 • Optimisation OS et réseau

    Ajuste les paramètres du noyau Linux, les ordonnanceurs d'E/S disque et les tampons réseau pour les charges de travail HBase. Empêche les goulots d'étranglement au niveau de l'OS de masquer les gains d'optimisation de HBase.

  • Leçon 5 • Intégration avec les piles de surveillance

    Connecte les métriques HBase aux tableaux de bord Grafana via les exportateurs Prometheus ou Ganglia. Construit des règles d'alerte pour les seuils critiques comme la pause GC et le nombre de fichiers de store.

Chapitre 8Voir les détails

Haute disponibilité et réplication HBase

  • Leçon 1 • Tolérance aux pannes RegionServer

    Explique la réaffectation des régions après une panne RegionServer et la récupération basée sur WAL. Ajuste les paramètres de vitesse de récupération pour minimiser les fenêtres d'indisponibilité.

  • Leçon 2 • Architecture de réplication HBase

    Configure la réplication asynchrone basée sur WAL entre les clusters source et pair. Explique la portée de la réplication, la gestion des pairs et la surveillance du retard de réplication.

  • Leçon 3 • Haute disponibilité HMaster

    Déploie les instances HMaster de secours et configure l'élection du leader basée sur ZooKeeper. Teste le basculement automatique en simulant une panne du maître actif.

  • Leçon 4 • Gestion du quorum ZooKeeper

    Dimensionne et configure un ensemble ZooKeeper pour la fiabilité de la coordination HBase. Couvre l'ajustement du délai d'expiration de session et la gestion du répertoire de données ZooKeeper.

  • Leçon 5 • Sauvegarde, instantané et restauration

    Utilise les outils HBase snapshot et ExportSnapshot pour les sauvegardes ponctuelles sans temps d'arrêt. Pratique les procédures de restauration complète et incrémentielle pour valider la récupération.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieurs de données prêts à dépasser les bases de données relationnelles pour explorer le territoire NoSQL.

  • Développeurs back-end construisant des systèmes devant gérer un débit d'écriture massif.

  • Administrateurs Hadoop souhaitant ajouter l'expertise HBase à leur ensemble de compétences.

  • Architectes de solutions évaluant les magasins de colonnes larges pour les plateformes de données d'entreprise.

  • Ingénieurs logiciels en transition vers des rôles big data dans des entreprises axées sur les données.

  • Professionnels DevOps chargés de déployer et de maintenir des clusters de stockage distribués.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Cameroun ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF