
Curso de Apache HBase para Big Data
Domina Apache HBase, desde los fundamentos de la arquitectura hasta el despliegue, ajuste y replicación en producción. Esta formación dota a los ingenieros de datos y arquitectos de las competencias prácticas para diseñar soluciones de almacenamiento NoSQL escalables para cargas de trabajo reales de big data. Ve más allá de la teoría y desarrolla la experiencia de la que dependen los equipos empresariales.
Lo que vas a aprender:
Configura clústeres HBase autónomos, pseudodistribuidos y completamente distribuidos desde cero.
Diseña claves de fila y esquemas que eviten la concentración de puntos calientes y permitan escaneos de rango eficientes.
Implementa operaciones CRUD, por lotes y de escaneo usando la API de cliente Java de HBase.
Ajusta la recolección de basura de la JVM, el BlockCache y las políticas de compactación para cumplir los objetivos de latencia.
Configura la replicación entre clústeres basada en WAL y la conmutación por error de alta disponibilidad de HMaster.
Integra HBase con Apache Spark, Hive, Kafka y Apache Phoenix para canalizaciones integrales.
Cómo estudias de forma práctica Curso de Apache HBase para Big Data
Cómo practicas Curso de Apache HBase para Big Data
Para ti que eres empresa y quieres formar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 39 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de HBase y Contexto de Big Data
Fundamentos de HBase y Contexto de Big Data
Lección 1 • HBase frente a otros almacenes NoSQL
Compara HBase con sus pares de documentos, clave-valor y columnas anchas en cuanto a consistencia, latencia y rendimiento de transferencia. Guía a los estudiantes en la selección de HBase para cargas de trabajo apropiadas.
Lección 2 • Panorama general de la arquitectura de HBase
Presenta el modelo de servidor maestro-región de HBase y su relación con HDFS. Proporciona el modelo mental estructural necesario para todos los capítulos siguientes.
Lección 3 • Desafíos del almacenamiento de big data
Examina los problemas de volumen, velocidad y variedad que las bases de datos relacionales no pueden manejar. Establece la motivación para soluciones NoSQL columnares como HBase.
Lección 4 • Conceptos del modelo de datos de HBase
Define tablas, filas, familias de columnas, cualificadores y marcas de tiempo. Los estudiantes relacionan estos conceptos con casos de uso reales para desarrollar la intuición antes del trabajo práctico.
Capítulo 2OcultarOcultar detallesVer detallesInstalación y configuración de HBase
Instalación y configuración de HBase
Lección 1 • Configuración en modo pseudo-distribuido
Configura HBase para usar HDFS en una sola máquina, simulando un clúster. Presenta los parámetros de hbase-site.xml que gobiernan el comportamiento distribuido.
Lección 2 • Instalación en modo autónomo
Guía la configuración de HBase en un solo nodo para desarrollo y pruebas. Valida la instalación con comandos básicos de shell antes de avanzar a modos distribuidos.
Lección 3 • Requisitos previos del entorno y planificación
Cubre los requisitos de Java, Hadoop y del sistema operativo antes de cualquier paso de instalación. Previene fallos comunes de configuración al abordar los conflictos de dependencias por adelantado.
Lección 4 • Parámetros de configuración principales
Ajusta hbase-site.xml, hbase-env.sh y la configuración de heap de JVM para la estabilidad. Conecta las elecciones de configuración con los resultados de rendimiento y fiabilidad.
Lección 5 • Despliegue de clúster totalmente distribuido
Despliega HBase en múltiples nodos con quorum de ZooKeeper y replicación HDFS. Los estudiantes configuran el archivo regionservers y prueban la preparación para la conmutación por error.
Capítulo 3OcultarOcultar detallesVer detallesShell de HBase y operaciones básicas de datos
Shell de HBase y operaciones básicas de datos
Lección 1 • Actualización y eliminación de datos
Explica el modelo de escritura de solo añadir de HBase y cómo las eliminaciones utilizan marcadores de lápida. Los estudiantes practican patrones de eliminación seguros para evitar la pérdida de datos no intencionada.
Lección 2 • Navegación por el shell de HBase
Presenta los comandos del shell, el sistema de ayuda y las capacidades de scripting. Establece hábitos eficientes de uso del shell antes de realizar operaciones de datos.
Lección 3 • Gestión de tablas y esquemas
Cubre los comandos create, alter, disable, enable y drop para tablas. Enseña decisiones de diseño de esquemas que afectan la eficiencia del almacenamiento y el rendimiento de las consultas.
Lección 4 • Carga masiva de datos
Utiliza las herramientas ImportTsv y completebulkload para cargar grandes conjuntos de datos de manera eficiente. Evita los cuellos de botella de la ruta de escritura generando HFiles directamente.
Lección 5 • Escritura y lectura de datos
Demuestra los comandos put, get y scan con filtros y control de versiones. Conecta los patrones de lectura/escritura con el modelo de almacenamiento subyacente de árbol LSM.
Capítulo 4OcultarOcultar detallesVer detallesDiseño de clave de fila y modelado de esquemas
Diseño de clave de fila y modelado de esquemas
Lección 1 • Técnicas de salado y hashing
Aplica prefijos de salado y claves basadas en hash para distribuir las escrituras entre regiones. Los estudiantes miden la mejora de la distribución utilizando métricas de carga del servidor de región.
Lección 2 • Estrategias de diseño de familias de columnas
Guía las decisiones sobre el número de familias de columnas, tamaño de bloque y compresión. Conecta la configuración a nivel de familia con el comportamiento de MemStore y HFile.
Lección 3 • Patrones de esquema para casos de uso comunes
Aplica patrones de series temporales, entidad-atributo-valor e índice invertido a escenarios reales. Los estudiantes evalúan el coste de exploración y almacenamiento de cada patrón.
Lección 4 • Principios de diseño de clave de fila
Explica cómo la estructura de la clave de fila determina la distribución de datos y la eficiencia de exploración. Establece las reglas fundamentales antes de introducir patrones de diseño específicos.
Lección 5 • Pre-división de regiones al crear la tabla
Demuestra la pre-división manual y algorítmica de regiones para evitar puntos calientes iniciales. Valida los límites de división contra la distribución de claves esperada.
Capítulo 5OcultarOcultar detallesVer detallesFuncionamiento interno de HBase y motor de almacenamiento
Funcionamiento interno de HBase y motor de almacenamiento
Lección 1 • Tipos y políticas de compactación
Distingue las compactaciones menores y mayores y su impacto en la amplificación de lectura y el almacenamiento. Los estudiantes configuran políticas de compactación para equilibrar los costes de escritura y lectura.
Lección 2 • División y fusión de regiones
Explica los desencadenantes de división de regiones automática y manual y el procedimiento de división. Cubre la fusión de regiones para consolidar regiones pequeñas y reducir la sobrecarga.
Lección 3 • WAL y configuración de durabilidad
Configura los modos de sincronización WAL, el factor de replicación y la compresión WAL para equilibrar durabilidad y rendimiento. Explica la recuperación de datos desde WAL tras un fallo.
Lección 4 • Ruta de escritura y MemStore
Traza una escritura de cliente a través del WAL, MemStore y el volcado eventual a HFile. Explica las garantías de durabilidad y las condiciones de activación del volcado.
Lección 5 • Formato HFile y caché de bloques
Examina la estructura de HFile v2, incluyendo bloques de datos, filtros bloom y bloques de índice. Conecta la configuración de la caché de bloques con la reducción de la latencia de lectura.
Capítulo 6OcultarOcultar detallesVer detallesAPI Java de HBase y programación de clientes
API Java de HBase y programación de clientes
Lección 1 • Filtros y consultas avanzadas
Implementa filtros del lado del servidor para reducir la transferencia de red y el procesamiento del lado del cliente. Cubre la construcción de filtros de fila, columna, valor y compuestos.
Lección 2 • API Scan e iteración de resultados
Utiliza la clase Scan con filas de inicio/parada, filtros y sugerencias de almacenamiento en caché para lecturas de rango eficientes. Enseña el ciclo de vida de ResultScanner y la liberación de recursos.
Lección 3 • Configuración del cliente Java
Configura las dependencias de Maven o Gradle y establece un objeto Connection. Cubre la carga de configuración y la gestión del ciclo de vida de la conexión.
Lección 4 • Operaciones por lotes y de mutación
Ejecuta puts y deletes masivos utilizando Table.batch y BufferedMutator para optimizar el rendimiento de transferencia. Maneja fallos parciales en matrices de resultados por lotes.
Lección 5 • Operaciones Put y Get en Java
Implementa escrituras y lecturas de una sola fila con orientación explícita de familia de columnas y cualificador. Introduce el análisis de resultados y patrones de seguridad nula.
Capítulo 7OcultarOcultar detallesVer detallesAjuste del rendimiento y monitorización de HBase
Ajuste del rendimiento y monitorización de HBase
Lección 1 • Ajuste de JVM y recolección de basura
Configura los ajustes de G1GC y CMS para reducir el impacto de las pausas de la recolección de basura en la latencia del RegionServer. Conecta el dimensionamiento del heap con la asignación de MemStore y BlockCache.
Lección 2 • Optimización de la ruta de lectura y escritura
Ajusta el almacenamiento en caché de exploración, los tamaños de lote y los parámetros del búfer de escritura para maximizar el rendimiento de transferencia. Aplica configuraciones del lado del cliente y del servidor en combinación.
Lección 3 • Métricas de HBase y monitorización JMX
Recopila métricas de HBase a través de JMX, Hadoop metrics2 y extremos REST. Identifica indicadores clave para latencia de lectura, cola de compactación y equilibrio de regiones.
Lección 4 • Optimización del sistema operativo y la red
Ajusta los parámetros del núcleo Linux, los planificadores de E/S de disco y los búferes de red para cargas de trabajo de HBase. Evita que los cuellos de botella a nivel de SO oculten las mejoras de ajuste de HBase.
Lección 5 • Integración con pilas de monitorización
Conecta las métricas de HBase a paneles de Grafana a través de exportadores Prometheus o Ganglia. Crea reglas de alerta para umbrales críticos como pausa de recolección de basura y recuento de archivos de almacén.
Capítulo 8OcultarOcultar detallesVer detallesAlta disponibilidad y replicación de HBase
Alta disponibilidad y replicación de HBase
Lección 1 • Tolerancia a fallos de RegionServer
Explica la reasignación de regiones tras un fallo de RegionServer y la recuperación basada en WAL. Ajusta los parámetros de velocidad de recuperación para minimizar las ventanas de indisponibilidad.
Lección 2 • Arquitectura de replicación de HBase
Configura la replicación asíncrona basada en WAL entre clústeres de origen y par. Explica el alcance de la replicación, la gestión de pares y la monitorización del retraso de replicación.
Lección 3 • Alta disponibilidad de HMaster
Despliega instancias de HMaster de respaldo y configura la elección de líder basada en ZooKeeper. Prueba la conmutación por error automática simulando un fallo del maestro activo.
Lección 4 • Gestión del quorum de ZooKeeper
Dimensiona y configura un conjunto de ZooKeeper para la fiabilidad de la coordinación de HBase. Cubre el ajuste de tiempos de espera de sesión y la gestión del directorio de datos de ZooKeeper.
Lección 5 • Copia de seguridad, instantánea y restauración
Utiliza las herramientas de instantáneas de HBase y ExportSnapshot para copias de seguridad puntuales sin tiempo de inactividad. Practica procedimientos de restauración completa e incremental para validar la recuperación.
Tu certificado válido de finalización
Este curso es para ti:
Ingenieros de datos preparados para ir más allá de las bases de datos relacionales y adentrarse en el territorio NoSQL.
Desarrolladores backend que construyen sistemas que deben gestionar un rendimiento de transferencia de escritura masivo.
Administradores de Hadoop que desean añadir experiencia en HBase a su conjunto de competencias.
Arquitectos de soluciones que evalúan almacenes de columnas anchas para plataformas de datos empresariales.
Ingenieros de software que transicionan hacia roles de big data en empresas con uso intensivo de datos.
Profesionales de DevOps encargados de desplegar y mantener clústeres de almacenamiento distribuido.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacéis, ya os he recomendado a otras personas...

Me gusta cómo las lecciones van directas al grano y cómo puedo cambiar de capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de vídeos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los vídeos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en España?
¿Los cursos son gratuitos?
¿Cuál es la carga lectiva del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el coste o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















