
Curso de Apache Hive para Big Data
Domina Apache Hive desde cero: diseña esquemas, escribe consultas potentes en HiveQL y ajusta el rendimiento en conjuntos de datos masivos. Este curso cubre desde los fundamentos de HDFS y las transacciones ACID hasta el despliegue en la nube, la seguridad y la orquestación de flujos de trabajo. Tanto si estás construyendo canalizaciones de datos empresariales como optimizando un data lakehouse, adquirirás las competencias prácticas que exigen los entornos de producción.
Lo que vas a aprender:
Diseña tablas Hive gestionadas y externas con particionamiento, bucketing y formatos de almacenamiento columnar.
Escribe consultas avanzadas en HiveQL utilizando funciones de ventana, CTE, subconsultas y uniones de múltiples tablas.
Optimiza la ejecución de consultas aplicando poda de particiones, vectorización y ajuste del optimizador basado en costes.
Aplica seguridad en Hive mediante autenticación Kerberos, políticas de Apache Ranger y enmascaramiento dinámico de datos.
Integra Hive con Apache Spark, almacenamiento de objetos en la nube y formatos de tabla abiertos como Apache Iceberg.
Automatiza canalizaciones de datos con Apache Airflow y Oozie, incluyendo carga incremental y verificaciones de calidad.
Cómo estudias de forma práctica Curso de Apache Hive para Big Data
Cómo practicas Curso de Apache Hive para Big Data
Para ti que eres empresa y quieres formar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesIntroducción al Big Data y Hive
Introducción al Big Data y Hive
Lección 1 • Arquitectura y Componentes de Hive
Explica los componentes principales de Hive: metastore, driver, compilador y motor de ejecución. Conecta la arquitectura con la comprensión del ciclo de vida de las consultas.
Lección 2 • Fundamentos y Retos del Big Data
Cubre los retos de volumen, velocidad y variedad que impulsan la adopción del big data. Establece el contexto de por qué existen herramientas de procesamiento distribuido como Hive.
Lección 3 • Configuración de un Entorno Hive
Guía la instalación y configuración de un entorno Hive local o en un entorno aislado. Proporciona preparación práctica para todos los capítulos siguientes.
Lección 4 • Hive vs. Bases de Datos Tradicionales
Contrasta el modelo de esquema en lectura de Hive con el esquema en escritura de los SGBDR. Los estudiantes comprenden cuándo es apropiado Hive frente a las alternativas relacionales.
Capítulo 2OcultarOcultar detallesVer detallesFundamentos de HiveQL y Tipos de Datos
Fundamentos de HiveQL y Tipos de Datos
Lección 1 • Tipos de Datos Primitivos y Complejos
Cubre los primitivos numéricos, de cadena, booleanos y de fecha, junto con los tipos complejos ARRAY, MAP y STRUCT. La selección correcta del tipo afecta al almacenamiento y la precisión de las consultas.
Lección 2 • Sintaxis de HiveQL y Estructura de las Consultas
Presenta HiveQL como un dialecto SQL con extensiones específicas de Hive. Cubre las cláusulas SELECT, FROM, WHERE y ORDER BY como bloques fundamentales.
Lección 3 • Agregación y Agrupamiento
Enseña GROUP BY, HAVING y funciones de agregación para resumir conjuntos de datos. La agregación es fundamental para los patrones de consulta analíticos utilizados a lo largo del curso.
Lección 4 • Subconsultas y Expresiones de Tabla Comunes
Introduce las vistas en línea, las subconsultas y las CTE con la cláusula WITH para un diseño modular de consultas. Estos patrones aparecen en consultas analíticas complejas en capítulos posteriores.
Lección 5 • Funciones Integradas y Operadores
Examina las funciones integradas de cadena, matemáticas, fecha y condicionales. Los estudiantes aplican funciones para transformar y evaluar datos dentro de las consultas.
Capítulo 3OcultarOcultar detallesVer detallesDiseño de Bases de Datos y Tablas en Hive
Diseño de Bases de Datos y Tablas en Hive
Lección 1 • Particionamiento de Tablas
Enseña el particionamiento estático y dinámico para reducir los escaneos completos de tabla. El particionamiento es la técnica principal para mejorar el rendimiento de las consultas en tablas grandes.
Lección 2 • Creación y Gestión de Bases de Datos
Cubre CREATE DATABASE, DROP DATABASE y las propiedades de las bases de datos. Una organización adecuada de las bases de datos respalda la gobernanza de datos entre múltiples equipos.
Lección 3 • Formatos de Almacenamiento de Tablas
Compara los formatos de almacenamiento TextFile, SequenceFile, ORC y Parquet. La elección del formato impacta directamente en la velocidad de consulta y la eficiencia del almacenamiento.
Lección 4 • Tablas Gestionadas vs. Externas
Distingue las tablas gestionadas (datos propiedad de Hive) de las tablas externas (datos propiedad del usuario). Elegir correctamente previene la pérdida accidental de datos.
Lección 5 • Bucketing y Agrupación en Clústeres
Introduce el bucketing como complemento al particionamiento para una distribución uniforme de los datos. Las tablas agrupadas en buckets permiten un muestreo eficiente y la optimización de joins.
Capítulo 4OcultarOcultar detallesVer detallesCarga, Inserción y Gestión de Datos
Carga, Inserción y Gestión de Datos
Lección 1 • Carga de Datos desde Archivos
Cubre LOAD DATA LOCAL y LOAD DATA desde rutas HDFS. La carga basada en archivos es el patrón de ingesta inicial más común en los flujos de trabajo de Hive.
Lección 2 • Transacciones ACID y Operaciones CRUD
Explica el soporte ACID de Hive que permite UPDATE y DELETE en tablas ORC. Las operaciones ACID requieren una configuración y propiedades de tabla específicas.
Lección 3 • Patrones INSERT e INSERT OVERWRITE
Enseña INSERT INTO e INSERT OVERWRITE para la población de datos basada en consultas. Estos patrones soportan canalizaciones ETL construidas enteramente dentro de HiveQL.
Lección 4 • Exportación y Archivado de Datos
Cubre los comandos INSERT OVERWRITE DIRECTORY y EXPORT/IMPORT. La exportación de datos soporta el consumo posterior y la migración entre clústeres.
Capítulo 5OcultarOcultar detallesVer detallesJoins, Uniones y Consultas Avanzadas
Joins, Uniones y Consultas Avanzadas
Lección 1 • Skew Joins y Manejo del Sesgo de Datos
Aborda el sesgo en joins causado por valores de clave de alta frecuencia que sobrecargan los reductores. La optimización de skew join distribuye las claves calientes entre múltiples tareas.
Lección 2 • Tipos de Join y Sintaxis
Cubre los joins INNER, LEFT, RIGHT, FULL OUTER y CROSS con sintaxis HiveQL. Comprender la semántica de los joins previene conjuntos de resultados incorrectos.
Lección 3 • UNION, INTERSECT y EXCEPT
Enseña operaciones de conjuntos para combinar y comparar conjuntos de resultados entre consultas. Estas operaciones soportan patrones de deduplicación y análisis diferencial.
Lección 4 • Map-Side Joins y Broadcast Joins
Explica los map-side joins usando la sugerencia MAPJOIN para la optimización de tablas pequeñas. Los broadcast joins eliminan la sobrecarga de la mezcla en joins de tablas grandes con pequeñas.
Lección 5 • Funciones de Ventana y Analíticas
Introduce OVER, PARTITION BY y ORDER BY para ranking y agregaciones continuas. Las funciones de ventana permiten analíticas avanzadas sin colapsar la granularidad de las filas.
Capítulo 6OcultarOcultar detallesVer detallesTécnicas de Optimización de Consultas
Técnicas de Optimización de Consultas
Lección 1 • Comprensión del Plan de Ejecución de Consultas
Utiliza EXPLAIN y EXPLAIN EXTENDED para interpretar los planes de ejecución de MapReduce y Tez. Leer los planes es la habilidad previa necesaria para todas las decisiones de optimización.
Lección 2 • Ajuste del Motor de Ejecución Tez
Configura la ejecución DAG de Tez para una latencia reducida en comparación con MapReduce. Tez es el motor recomendado para cargas de trabajo interactivas e iterativas de Hive.
Lección 3 • Poda de Particiones y Predicado Pushdown
Asegura que las consultas escaneen solo las particiones relevantes y empujen los filtros lo antes posible. Estas técnicas reducen la E/S, que es el coste dominante en las consultas de Hive.
Lección 4 • Optimización del Formato de Archivo y Compresión
Selecciona ORC y Parquet con códecs de compresión apropiados para minimizar el tiempo de escaneo. La compresión reduce tanto el coste de almacenamiento como la E/S de red durante la ejecución de consultas.
Lección 5 • Vectorización y Optimizador Basado en Costes
Habilita la ejecución de consultas vectorizada y el optimizador basado en costes (CBO) para la mejora automática de planes. Ambos requieren la recopilación de estadísticas para funcionar correctamente.
Capítulo 7OcultarOcultar detallesVer detallesFunciones Definidas por el Usuario y Extensibilidad
Funciones Definidas por el Usuario y Extensibilidad
Lección 1 • Funciones de Tabla Definidas por el Usuario
Construye UDTF que emiten múltiples filas a partir de una sola fila de entrada usando la interfaz UDTF. Las UDTF soportan la expansión de estructuras anidadas y la generación de filas personalizadas.
Lección 2 • Funciones de Agregación Definidas por el Usuario
Implementa UDAF usando las interfaces UDAF y GenericUDAF para agregaciones personalizadas. Las UDAF operan entre grupos de reducción y requieren gestión de búferes.
Lección 3 • Fundamentos del Desarrollo de UDF
Cubre la clase base UDF, el método evaluate y el empaquetado JAR para funciones escalares simples. Las UDF llenan los vacíos donde las funciones integradas son insuficientes.
Lección 4 • Transformaciones Basadas en Python y Scripts
Utiliza TRANSFORM y scripts de streaming para aplicar lógica de Python o shell dentro de HiveQL. Las transformaciones de script permiten la creación rápida de prototipos sin compilación Java.
Capítulo 8OcultarOcultar detallesVer detallesHive en Producción: Seguridad y Gobernanza
Hive en Producción: Seguridad y Gobernanza
Lección 1 • Gestión del Metastore y Alta Disponibilidad
Configura un metastore remoto con un backend relacional y una configuración de alta disponibilidad. La fiabilidad del metastore es crítica para un servicio Hive ininterrumpido en producción.
Lección 2 • Modelos de Autorización: Estándares SQL y Ranger
Compara la autorización estándar SQL de Hive con el control basado en políticas de Apache Ranger. La autorización detallada impone el acceso con privilegios mínimos a nivel de columna.
Lección 3 • Autenticación e Integración con Kerberos
Configura la autenticación basada en Kerberos para HiveServer2 y las conexiones de cliente. La autenticación previene el acceso no autorizado a activos de datos sensibles.
Lección 4 • Enmascaramiento y Cifrado de Datos
Aplica políticas dinámicas de enmascaramiento de datos y zonas de cifrado HDFS para proteger columnas sensibles. El enmascaramiento permite analíticas sobre datos sensibles sin exponer los valores brutos.
Lección 5 • Auditoría y Registro de Cumplimiento
Habilita los registros de auditoría de consultas a través de HiveServer2 y las pistas de auditoría de Apache Ranger. Los registros de auditoría satisfacen los requisitos de cumplimiento normativo para el seguimiento del acceso a datos.
Tu certificado válido de finalización
Este curso es para ti:
Analistas de datos preparados para llevar sus competencias más allá de las hojas de cálculo y SQL.
Ingenieros de software en transición hacia roles de big data y sistemas distribuidos.
Desarrolladores de ETL que desean modernizar sus canalizaciones con herramientas basadas en Hadoop.
Administradores de bases de datos que exploran el almacenamiento columnar y el ajuste de consultas a gran escala.
Profesionales de inteligencia de negocio cuyos conjuntos de datos han superado las bases de datos relacionales.
Ingenieros de la nube encargados de construir o migrar infraestructura de almacén de datos.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacéis, ya os he recomendado a otras personas...

Me gusta cómo las lecciones van directas al grano y cómo puedo cambiar de capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de vídeos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los vídeos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en España?
¿Los cursos son gratuitos?
¿Cuál es la carga lectiva del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el coste o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















