
Formation Apache HBase pour le stockage Big Data
Maîtrisez Apache HBase, des fondamentaux de l'architecture logicielle jusqu'au déploiement, au réglage et à la réplication de niveau production. Cette formation dote les ingénieurs de données et les architectes des compétences pratiques nécessaires pour concevoir des solutions de stockage NoSQL évolutives pour de véritables charges de travail big data. Allez au-delà de la théorie et développez l'expertise sur laquelle les équipes en entreprise comptent.
Ce que vous allez apprendre:
Configurez des clusters HBase autonomes, pseudo-distribués et entièrement distribués à partir de zéro.
Concevez des clés de ligne et des schémas qui empêchent le hotspotting et prennent en charge des analyses par plage efficaces.
Mettez en œuvre des opérations CRUD, par lots et d'analyse à l'aide de l'API Java client HBase.
Ajustez le ramasse-miettes JVM, le BlockCache et les politiques de compaction pour atteindre les objectifs de latence.
Configurez la réplication inter-clusters basée sur WAL et le basculement haute disponibilité HMaster.
Intégrez HBase avec Apache Spark, Hive, Kafka et Apache Phoenix pour des pipelines de bout en bout.
Comment vous étudiez de façon pratique Formation Apache HBase pour le stockage Big Data
Comment vous pratiquez Formation Apache HBase pour le stockage Big Data
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements HBase et Contexte Big Data
Fondements HBase et Contexte Big Data
Leçon 1 • HBase contre les autres magasins NoSQL
Compare HBase avec les pairs document, clé-valeur et large colonne sur la cohérence, la latence et le débit. Guide les étudiants dans la sélection de HBase pour les charges de travail appropriées.
Leçon 2 • Aperçu de l'architecture HBase
Présente le modèle maître-serveur de région de HBase et sa relation avec HDFS. Fournit le modèle mental structurel nécessaire pour tous les chapitres suivants.
Leçon 3 • Défis du stockage Big Data
Examine les problèmes de volume, de vélocité et de variété que les bases de données relationnelles ne peuvent pas gérer. Pose la motivation pour les solutions NoSQL columnaires comme HBase.
Leçon 4 • Concepts du modèle de données HBase
Définit les tables, les lignes, les familles de colonnes, les qualificatifs et les horodatages. Les étudiants mappent ces concepts à des cas d'utilisation réels pour construire l'intuition avant le travail pratique.
Chapitre 2MasquerCacher les détailsVoir les détailsInstallation et configuration de HBase
Installation et configuration de HBase
Leçon 1 • Configuration du mode pseudo-distribué
Configure HBase pour utiliser HDFS sur une seule machine, simulant un cluster. Introduit les paramètres hbase-site.xml qui régissent le comportement distribué.
Leçon 2 • Installation en mode autonome
Guide l'installation HBase sur un nœud unique pour le développement et les tests. Valide l'installation avec des commandes shell de base avant de passer aux modes distribués.
Leçon 3 • Prérequis d'environnement et planification
Couvre les exigences Java, Hadoop et OS avant toute étape d'installation. Évite les échecs de configuration courants en traitant les conflits de dépendances en amont.
Leçon 4 • Paramètres de configuration de base
Ajuste les paramètres hbase-site.xml, hbase-env.sh et JVM heap pour la stabilité. Relie les choix de configuration aux résultats de performance et de fiabilité.
Leçon 5 • Déploiement de cluster entièrement distribué
Déploie HBase sur plusieurs nœuds avec un quorum ZooKeeper et une réplication HDFS. Les étudiants configurent le fichier regionservers et testent la préparation au basculement.
Chapitre 3MasquerCacher les détailsVoir les détailsShell HBase et opérations de données de base
Shell HBase et opérations de données de base
Leçon 1 • Mise à jour et suppression de données
Explique le modèle d'écriture append-only de HBase et comment les suppressions utilisent des marqueurs de tombe. Les étudiants pratiquent des modèles de suppression sécurisés pour éviter une perte de données involontaire.
Leçon 2 • Navigation dans le shell HBase
Introduit les commandes shell, le système d'aide et les capacités de script. Établit des habitudes d'utilisation efficaces du shell avant d'effectuer des opérations sur les données.
Leçon 3 • Gestion des tables et des schémas
Couvre les commandes create, alter, disable, enable, et drop pour les tables. Enseigne les décisions de conception de schéma qui affectent l'efficacité du stockage et les performances des requêtes.
Leçon 4 • Chargement en masse de données
Utilise les outils ImportTsv et completebulkload pour charger efficacement de grands ensembles de données. Évite les goulots d'étranglement du chemin d'écriture en générant des HFiles directement.
Leçon 5 • Écriture et lecture de données
Démontre les commandes put, get et scan avec des filtres et le contrôle de version. Relie les modèles de lecture/écriture au modèle de stockage sous-jacent LSM-tree.
Chapitre 4MasquerCacher les détailsVoir les détailsConception de clé de ligne et modélisation de schéma
Conception de clé de ligne et modélisation de schéma
Leçon 1 • Techniques de salage et de hachage
Applique les préfixes de salage et les clés basées sur le hachage pour distribuer les écritures entre les régions. Les étudiants mesurent l'amélioration de la distribution à l'aide des métriques de charge du serveur de région.
Leçon 2 • Stratégies de conception de familles de colonnes
Guide les décisions sur le nombre de familles de colonnes, la taille de bloc et la compression. Relie les paramètres au niveau de la famille au comportement MemStore et HFile.
Leçon 3 • Modèles de schéma pour les cas d'utilisation courants
Applique les modèles de séries temporelles, entité-attribut-valeur et index inversé à des scénarios réels. Les étudiants évaluent le coût de scan et de stockage de chaque modèle.
Leçon 4 • Principes de conception de clé de ligne
Explique comment la structure de la clé de ligne détermine la distribution des données et l'efficacité du scan. Établit les règles fondamentales avant d'introduire des modèles de conception spécifiques.
Leçon 5 • Pré-découpage des régions à la création de table
Démontre le pré-découpage manuel et algorithmique des régions pour éviter les hotspots initiaux. Valide les limites de découpage par rapport à la distribution de clés attendue.
Chapitre 5MasquerCacher les détailsVoir les détailsInternes HBase et moteur de stockage
Internes HBase et moteur de stockage
Leçon 1 • Types et politiques de compactage
Distingue les compactages mineurs et majeurs et leur impact sur l'amplification de lecture et le stockage. Les étudiants configurent les politiques de compactage pour équilibrer les coûts d'écriture et de lecture.
Leçon 2 • Découpage et fusion de régions
Explique les déclencheurs de découpage automatique et manuel des régions et la procédure de découpage. Couvre la fusion de régions pour consolider les petites régions et réduire la surcharge.
Leçon 3 • Configuration WAL et durabilité
Configure les modes de synchronisation WAL, le facteur de réplication et la compression WAL pour équilibrer durabilité et performance. Explique la récupération des données à partir du WAL après un crash.
Leçon 4 • Chemin d'écriture et MemStore
Trace une écriture client à travers le WAL, le MemStore, et le vidage éventuel du HFile. Explique les garanties de durabilité et les conditions de déclenchement du vidage.
Leçon 5 • Format HFile et cache de blocs
Examine la structure HFile v2, y compris les blocs de données, les filtres bloom et les blocs d'index. Relie la configuration du cache de blocs à la réduction de la latence de lecture.
Chapitre 6MasquerCacher les détailsVoir les détailsAPI Java HBase et programmation client
API Java HBase et programmation client
Leçon 1 • Filtres et requêtes avancées
Implémente des filtres côté serveur pour réduire le transfert réseau et le traitement côté client. Couvre la construction de filtres de ligne, de colonne, de valeur et composite.
Leçon 2 • API Scan et itération des résultats
Utilise la classe Scan avec les lignes de début/fin, les filtres et les indications de mise en cache pour les lectures efficaces de plage. Enseigne le cycle de vie de ResultScanner et le nettoyage des ressources.
Leçon 3 • Configuration du client Java
Configure les dépendances Maven ou Gradle et établit un objet Connection. Couvre le chargement de la configuration et la gestion du cycle de vie de la connexion.
Leçon 4 • Opérations par lots et Mutate
Exécute des puts et deletes en masse à l'aide de Table.batch et BufferedMutator pour l'optimisation du débit. Gère les échecs partiels dans les tableaux de résultats batch.
Leçon 5 • Opérations Put et Get en Java
Implémente les écritures et lectures de lignes uniques avec un ciblage explicite de la famille de colonnes et du qualificatif. Introduit l'analyse des résultats et les modèles de sécurité null.
Chapitre 7MasquerCacher les détailsVoir les détailsAjustement des performances et surveillance HBase
Ajustement des performances et surveillance HBase
Leçon 1 • Ajustement JVM et garbage collection
Configure les paramètres G1GC et CMS pour réduire l'impact des pauses GC sur la latence du RegionServer. Relie le dimensionnement du tas à l'allocation MemStore et BlockCache.
Leçon 2 • Optimisation du chemin de lecture et d'écriture
Ajuste la mise en cache des scans, les tailles de lots et les paramètres du tampon d'écriture pour maximiser le débit. Applique les paramètres côté client et côté serveur en combinaison.
Leçon 3 • Métriques HBase et surveillance JMX
Collecte les métriques HBase via JMX, Hadoop metrics2 et les endpoints REST. Identifie les indicateurs clés pour la latence de lecture, la file d'attente de compactage et l'équilibre des régions.
Leçon 4 • Optimisation OS et réseau
Ajuste les paramètres du noyau Linux, les ordonnanceurs d'E/S disque et les tampons réseau pour les charges de travail HBase. Empêche les goulots d'étranglement au niveau de l'OS de masquer les gains d'optimisation de HBase.
Leçon 5 • Intégration avec les piles de surveillance
Connecte les métriques HBase aux tableaux de bord Grafana via les exportateurs Prometheus ou Ganglia. Construit des règles d'alerte pour les seuils critiques comme la pause GC et le nombre de fichiers de store.
Chapitre 8MasquerCacher les détailsVoir les détailsHaute disponibilité et réplication HBase
Haute disponibilité et réplication HBase
Leçon 1 • Tolérance aux pannes RegionServer
Explique la réaffectation des régions après une panne RegionServer et la récupération basée sur WAL. Ajuste les paramètres de vitesse de récupération pour minimiser les fenêtres d'indisponibilité.
Leçon 2 • Architecture de réplication HBase
Configure la réplication asynchrone basée sur WAL entre les clusters source et pair. Explique la portée de la réplication, la gestion des pairs et la surveillance du retard de réplication.
Leçon 3 • Haute disponibilité HMaster
Déploie les instances HMaster de secours et configure l'élection du leader basée sur ZooKeeper. Teste le basculement automatique en simulant une panne du maître actif.
Leçon 4 • Gestion du quorum ZooKeeper
Dimensionne et configure un ensemble ZooKeeper pour la fiabilité de la coordination HBase. Couvre l'ajustement du délai d'expiration de session et la gestion du répertoire de données ZooKeeper.
Leçon 5 • Sauvegarde, instantané et restauration
Utilise les outils HBase snapshot et ExportSnapshot pour les sauvegardes ponctuelles sans temps d'arrêt. Pratique les procédures de restauration complète et incrémentielle pour valider la récupération.
Votre certificat valide de réussite
Ce cours est pour vous :
Ingénieurs de données prêts à dépasser les bases de données relationnelles pour explorer le territoire NoSQL.
Développeurs back-end construisant des systèmes devant gérer un débit d'écriture massif.
Administrateurs Hadoop souhaitant ajouter l'expertise HBase à leur ensemble de compétences.
Architectes de solutions évaluant les magasins de colonnes larges pour les plateformes de données d'entreprise.
Ingénieurs logiciels en transition vers des rôles big data dans des entreprises axées sur les données.
Professionnels DevOps chargés de déployer et de maintenir des clusters de stockage distribués.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Cameroun ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















