Elige tu idioma
Curso de Apache HBase para Big Data
Más de 2 millones de estudiantes en todo el mundo

Curso de Apache HBase para Big Data

Domina Apache HBase, desde los fundamentos de la arquitectura hasta el despliegue, ajuste y replicación en producción. Esta formación dota a los ingenieros de datos y arquitectos de las competencias prácticas para diseñar soluciones de almacenamiento NoSQL escalables para cargas de trabajo reales de big data. Ve más allá de la teoría y desarrolla la experiencia de la que dependen los equipos empresariales.

Dedika para empresas

Lo que vas a aprender:

  • Configura clústeres HBase autónomos, pseudodistribuidos y completamente distribuidos desde cero.

  • Diseña claves de fila y esquemas que eviten la concentración de puntos calientes y permitan escaneos de rango eficientes.

  • Implementa operaciones CRUD, por lotes y de escaneo usando la API de cliente Java de HBase.

  • Ajusta la recolección de basura de la JVM, el BlockCache y las políticas de compactación para cumplir los objetivos de latencia.

  • Configura la replicación entre clústeres basada en WAL y la conmutación por error de alta disponibilidad de HMaster.

  • Integra HBase con Apache Spark, Hive, Kafka y Apache Phoenix para canalizaciones integrales.

Cómo estudias de forma práctica Curso de Apache HBase para Big Data

Cómo practicas Curso de Apache HBase para Big Data

Para ti que eres empresa y quieres formar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 39 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de HBase y Contexto de Big Data

  • Lección 1 • HBase frente a otros almacenes NoSQL

    Compara HBase con sus pares de documentos, clave-valor y columnas anchas en cuanto a consistencia, latencia y rendimiento de transferencia. Guía a los estudiantes en la selección de HBase para cargas de trabajo apropiadas.

  • Lección 2 • Panorama general de la arquitectura de HBase

    Presenta el modelo de servidor maestro-región de HBase y su relación con HDFS. Proporciona el modelo mental estructural necesario para todos los capítulos siguientes.

  • Lección 3 • Desafíos del almacenamiento de big data

    Examina los problemas de volumen, velocidad y variedad que las bases de datos relacionales no pueden manejar. Establece la motivación para soluciones NoSQL columnares como HBase.

  • Lección 4 • Conceptos del modelo de datos de HBase

    Define tablas, filas, familias de columnas, cualificadores y marcas de tiempo. Los estudiantes relacionan estos conceptos con casos de uso reales para desarrollar la intuición antes del trabajo práctico.

Capítulo 2Ver detalles

Instalación y configuración de HBase

  • Lección 1 • Configuración en modo pseudo-distribuido

    Configura HBase para usar HDFS en una sola máquina, simulando un clúster. Presenta los parámetros de hbase-site.xml que gobiernan el comportamiento distribuido.

  • Lección 2 • Instalación en modo autónomo

    Guía la configuración de HBase en un solo nodo para desarrollo y pruebas. Valida la instalación con comandos básicos de shell antes de avanzar a modos distribuidos.

  • Lección 3 • Requisitos previos del entorno y planificación

    Cubre los requisitos de Java, Hadoop y del sistema operativo antes de cualquier paso de instalación. Previene fallos comunes de configuración al abordar los conflictos de dependencias por adelantado.

  • Lección 4 • Parámetros de configuración principales

    Ajusta hbase-site.xml, hbase-env.sh y la configuración de heap de JVM para la estabilidad. Conecta las elecciones de configuración con los resultados de rendimiento y fiabilidad.

  • Lección 5 • Despliegue de clúster totalmente distribuido

    Despliega HBase en múltiples nodos con quorum de ZooKeeper y replicación HDFS. Los estudiantes configuran el archivo regionservers y prueban la preparación para la conmutación por error.

Capítulo 3Ver detalles

Shell de HBase y operaciones básicas de datos

  • Lección 1 • Actualización y eliminación de datos

    Explica el modelo de escritura de solo añadir de HBase y cómo las eliminaciones utilizan marcadores de lápida. Los estudiantes practican patrones de eliminación seguros para evitar la pérdida de datos no intencionada.

  • Lección 2 • Navegación por el shell de HBase

    Presenta los comandos del shell, el sistema de ayuda y las capacidades de scripting. Establece hábitos eficientes de uso del shell antes de realizar operaciones de datos.

  • Lección 3 • Gestión de tablas y esquemas

    Cubre los comandos create, alter, disable, enable y drop para tablas. Enseña decisiones de diseño de esquemas que afectan la eficiencia del almacenamiento y el rendimiento de las consultas.

  • Lección 4 • Carga masiva de datos

    Utiliza las herramientas ImportTsv y completebulkload para cargar grandes conjuntos de datos de manera eficiente. Evita los cuellos de botella de la ruta de escritura generando HFiles directamente.

  • Lección 5 • Escritura y lectura de datos

    Demuestra los comandos put, get y scan con filtros y control de versiones. Conecta los patrones de lectura/escritura con el modelo de almacenamiento subyacente de árbol LSM.

Capítulo 4Ver detalles

Diseño de clave de fila y modelado de esquemas

  • Lección 1 • Técnicas de salado y hashing

    Aplica prefijos de salado y claves basadas en hash para distribuir las escrituras entre regiones. Los estudiantes miden la mejora de la distribución utilizando métricas de carga del servidor de región.

  • Lección 2 • Estrategias de diseño de familias de columnas

    Guía las decisiones sobre el número de familias de columnas, tamaño de bloque y compresión. Conecta la configuración a nivel de familia con el comportamiento de MemStore y HFile.

  • Lección 3 • Patrones de esquema para casos de uso comunes

    Aplica patrones de series temporales, entidad-atributo-valor e índice invertido a escenarios reales. Los estudiantes evalúan el coste de exploración y almacenamiento de cada patrón.

  • Lección 4 • Principios de diseño de clave de fila

    Explica cómo la estructura de la clave de fila determina la distribución de datos y la eficiencia de exploración. Establece las reglas fundamentales antes de introducir patrones de diseño específicos.

  • Lección 5 • Pre-división de regiones al crear la tabla

    Demuestra la pre-división manual y algorítmica de regiones para evitar puntos calientes iniciales. Valida los límites de división contra la distribución de claves esperada.

Capítulo 5Ver detalles

Funcionamiento interno de HBase y motor de almacenamiento

  • Lección 1 • Tipos y políticas de compactación

    Distingue las compactaciones menores y mayores y su impacto en la amplificación de lectura y el almacenamiento. Los estudiantes configuran políticas de compactación para equilibrar los costes de escritura y lectura.

  • Lección 2 • División y fusión de regiones

    Explica los desencadenantes de división de regiones automática y manual y el procedimiento de división. Cubre la fusión de regiones para consolidar regiones pequeñas y reducir la sobrecarga.

  • Lección 3 • WAL y configuración de durabilidad

    Configura los modos de sincronización WAL, el factor de replicación y la compresión WAL para equilibrar durabilidad y rendimiento. Explica la recuperación de datos desde WAL tras un fallo.

  • Lección 4 • Ruta de escritura y MemStore

    Traza una escritura de cliente a través del WAL, MemStore y el volcado eventual a HFile. Explica las garantías de durabilidad y las condiciones de activación del volcado.

  • Lección 5 • Formato HFile y caché de bloques

    Examina la estructura de HFile v2, incluyendo bloques de datos, filtros bloom y bloques de índice. Conecta la configuración de la caché de bloques con la reducción de la latencia de lectura.

Capítulo 6Ver detalles

API Java de HBase y programación de clientes

  • Lección 1 • Filtros y consultas avanzadas

    Implementa filtros del lado del servidor para reducir la transferencia de red y el procesamiento del lado del cliente. Cubre la construcción de filtros de fila, columna, valor y compuestos.

  • Lección 2 • API Scan e iteración de resultados

    Utiliza la clase Scan con filas de inicio/parada, filtros y sugerencias de almacenamiento en caché para lecturas de rango eficientes. Enseña el ciclo de vida de ResultScanner y la liberación de recursos.

  • Lección 3 • Configuración del cliente Java

    Configura las dependencias de Maven o Gradle y establece un objeto Connection. Cubre la carga de configuración y la gestión del ciclo de vida de la conexión.

  • Lección 4 • Operaciones por lotes y de mutación

    Ejecuta puts y deletes masivos utilizando Table.batch y BufferedMutator para optimizar el rendimiento de transferencia. Maneja fallos parciales en matrices de resultados por lotes.

  • Lección 5 • Operaciones Put y Get en Java

    Implementa escrituras y lecturas de una sola fila con orientación explícita de familia de columnas y cualificador. Introduce el análisis de resultados y patrones de seguridad nula.

Capítulo 7Ver detalles

Ajuste del rendimiento y monitorización de HBase

  • Lección 1 • Ajuste de JVM y recolección de basura

    Configura los ajustes de G1GC y CMS para reducir el impacto de las pausas de la recolección de basura en la latencia del RegionServer. Conecta el dimensionamiento del heap con la asignación de MemStore y BlockCache.

  • Lección 2 • Optimización de la ruta de lectura y escritura

    Ajusta el almacenamiento en caché de exploración, los tamaños de lote y los parámetros del búfer de escritura para maximizar el rendimiento de transferencia. Aplica configuraciones del lado del cliente y del servidor en combinación.

  • Lección 3 • Métricas de HBase y monitorización JMX

    Recopila métricas de HBase a través de JMX, Hadoop metrics2 y extremos REST. Identifica indicadores clave para latencia de lectura, cola de compactación y equilibrio de regiones.

  • Lección 4 • Optimización del sistema operativo y la red

    Ajusta los parámetros del núcleo Linux, los planificadores de E/S de disco y los búferes de red para cargas de trabajo de HBase. Evita que los cuellos de botella a nivel de SO oculten las mejoras de ajuste de HBase.

  • Lección 5 • Integración con pilas de monitorización

    Conecta las métricas de HBase a paneles de Grafana a través de exportadores Prometheus o Ganglia. Crea reglas de alerta para umbrales críticos como pausa de recolección de basura y recuento de archivos de almacén.

Capítulo 8Ver detalles

Alta disponibilidad y replicación de HBase

  • Lección 1 • Tolerancia a fallos de RegionServer

    Explica la reasignación de regiones tras un fallo de RegionServer y la recuperación basada en WAL. Ajusta los parámetros de velocidad de recuperación para minimizar las ventanas de indisponibilidad.

  • Lección 2 • Arquitectura de replicación de HBase

    Configura la replicación asíncrona basada en WAL entre clústeres de origen y par. Explica el alcance de la replicación, la gestión de pares y la monitorización del retraso de replicación.

  • Lección 3 • Alta disponibilidad de HMaster

    Despliega instancias de HMaster de respaldo y configura la elección de líder basada en ZooKeeper. Prueba la conmutación por error automática simulando un fallo del maestro activo.

  • Lección 4 • Gestión del quorum de ZooKeeper

    Dimensiona y configura un conjunto de ZooKeeper para la fiabilidad de la coordinación de HBase. Cubre el ajuste de tiempos de espera de sesión y la gestión del directorio de datos de ZooKeeper.

  • Lección 5 • Copia de seguridad, instantánea y restauración

    Utiliza las herramientas de instantáneas de HBase y ExportSnapshot para copias de seguridad puntuales sin tiempo de inactividad. Practica procedimientos de restauración completa e incremental para validar la recuperación.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Ingenieros de datos preparados para ir más allá de las bases de datos relacionales y adentrarse en el territorio NoSQL.

  • Desarrolladores backend que construyen sistemas que deben gestionar un rendimiento de transferencia de escritura masivo.

  • Administradores de Hadoop que desean añadir experiencia en HBase a su conjunto de competencias.

  • Arquitectos de soluciones que evalúan almacenes de columnas anchas para plataformas de datos empresariales.

  • Ingenieros de software que transicionan hacia roles de big data en empresas con uso intensivo de datos.

  • Profesionales de DevOps encargados de desplegar y mantener clústeres de almacenamiento distribuido.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacéis, ya os he recomendado a otras personas...
Giulio Carlo
Giulio CarloAlumno de Marketing Digital
Me gusta cómo las lecciones van directas al grano y cómo puedo cambiar de capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresAlumna de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de vídeos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaAlumna de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los vídeos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeAlumno de Ingeniería de Prompts

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en España?

¿Los cursos son gratuitos?

¿Cuál es la carga lectiva del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el coste o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF