
Curso de Apache Hive para Big Data
Domina Apache Hive desde cero — diseñando esquemas, escribiendo consultas HiveQL potentes y ajustando el rendimiento en conjuntos de datos masivos. Este curso cubre desde los fundamentos de HDFS y transacciones ACID hasta despliegue en la nube, seguridad y orquestación de flujos de trabajo. Ya sea que estés construyendo pipelines de datos empresariales u optimizando un data lakehouse, obtendrás las habilidades prácticas que los entornos de producción demandan.
Lo que vas a aprender:
Diseña tablas Hive administradas y externas con particionado, bucketing y formatos de almacenamiento en columnas.
Escribe consultas HiveQL avanzadas usando funciones de ventana, CTEs, subconsultas y joins de múltiples tablas.
Optimiza la ejecución de consultas aplicando poda de particiones, vectorización y ajuste del optimizador basado en costos.
Implementa seguridad en Hive usando autenticación Kerberos, políticas de Apache Ranger y enmascaramiento dinámico de datos.
Integra Hive con Apache Spark, almacenamiento de objetos en la nube y formatos de tabla abiertos como Apache Iceberg.
Automatiza pipelines de datos con Apache Airflow y Oozie, incluyendo carga incremental y verificaciones de calidad.
Cómo estudias de forma práctica Curso de Apache Hive para Big Data
Cómo practicas Curso de Apache Hive para Big Data
Para ti que tienes una empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesIntroducción a Big Data y Hive
Introducción a Big Data y Hive
Lección 1 • Arquitectura y Componentes de Hive
Explica los componentes principales de Hive: metastore, driver, compilador y motor de ejecución. Conecta la arquitectura con la comprensión del ciclo de vida de las consultas.
Lección 2 • Fundamentos y Desafíos de Big Data
Cubre los desafíos de volumen, velocidad y variedad que impulsan la adopción de big data. Establece el contexto de por qué existen herramientas de procesamiento distribuido como Hive.
Lección 3 • Configuración de un Entorno Hive
Guía la instalación y configuración de un entorno Hive local o sandbox. Proporciona preparación práctica para todos los capítulos siguientes.
Lección 4 • Hive vs. Bases de Datos Tradicionales
Contrasta el modelo de esquema en lectura de Hive con el esquema en escritura de un RDBMS. Los estudiantes entienden cuándo Hive es apropiado versus las alternativas relacionales.
Capítulo 2OcultarOcultar detallesVer detallesFundamentos de HiveQL y Tipos de Datos
Fundamentos de HiveQL y Tipos de Datos
Lección 1 • Tipos de Datos Primitivos y Complejos
Cubre los primitivos numéricos, de cadena, booleanos y de fecha junto con los tipos complejos ARRAY, MAP y STRUCT. La selección correcta del tipo afecta el almacenamiento y la precisión de las consultas.
Lección 2 • Sintaxis de HiveQL y Estructura de Consultas
Presenta HiveQL como un dialecto SQL con extensiones específicas de Hive. Cubre las cláusulas SELECT, FROM, WHERE y ORDER BY como bloques de construcción.
Lección 3 • Agregación y Agrupamiento
Enseña GROUP BY, HAVING y funciones de agregado para resumir conjuntos de datos. La agregación es fundamental para los patrones de consultas analíticas utilizados a lo largo del curso.
Lección 4 • Subconsultas y Expresiones de Tabla Comunes
Introduce vistas en línea, subconsultas y CTEs con la cláusula WITH para un diseño de consultas modular. Estos patrones aparecen en consultas analíticas complejas en capítulos posteriores.
Lección 5 • Funciones Integradas y Operadores
Revisa funciones integradas de cadena, matemáticas, fecha y condicionales. Los estudiantes aplican funciones para transformar y evaluar datos dentro de las consultas.
Capítulo 3OcultarOcultar detallesVer detallesDiseño de Bases de Datos y Tablas en Hive
Diseño de Bases de Datos y Tablas en Hive
Lección 1 • Particionado de Tablas
Enseña el particionado estático y dinámico para reducir los escaneos completos de tabla. El particionado es la técnica principal para mejorar el rendimiento de las consultas en tablas grandes.
Lección 2 • Creación y Administración de Bases de Datos
Cubre CREATE DATABASE, DROP DATABASE y las propiedades de la base de datos. Una organización adecuada de la base de datos apoya la gobernanza de datos multi-equipo.
Lección 3 • Formatos de Almacenamiento de Tablas
Compara los formatos de almacenamiento TextFile, SequenceFile, ORC y Parquet. La elección del formato impacta directamente en la velocidad de consulta y la eficiencia del almacenamiento.
Lección 4 • Tablas Administradas vs. Externas
Distingue las tablas administradas (datos propiedad de Hive) de las tablas externas (datos propiedad del usuario). Elegir correctamente previene la pérdida accidental de datos.
Lección 5 • Bucketing y Clustering
Introduce el bucketing como complemento del particionado para una distribución uniforme de datos. Las tablas bucketeadas permiten un muestreo eficiente y la optimización de joins.
Capítulo 4OcultarOcultar detallesVer detallesCarga, Inserción y Administración de Datos
Carga, Inserción y Administración de Datos
Lección 1 • Carga de Datos desde Archivos
Cubre LOAD DATA LOCAL y LOAD DATA desde rutas HDFS. La carga basada en archivos es el patrón de ingesta inicial más común en los flujos de trabajo de Hive.
Lección 2 • Transacciones ACID y Operaciones CRUD
Explica el soporte ACID de Hive que permite UPDATE y DELETE en tablas ORC. Las operaciones ACID requieren configuración y propiedades de tabla específicas.
Lección 3 • Patrones de INSERT e INSERT OVERWRITE
Enseña INSERT INTO e INSERT OVERWRITE para la población de datos basada en consultas. Estos patrones soportan pipelines de ETL construidos completamente dentro de HiveQL.
Lección 4 • Exportación y Archivado de Datos
Cubre los comandos INSERT OVERWRITE DIRECTORY y EXPORT/IMPORT. La exportación de datos apoya el consumo downstream y la migración entre clústeres.
Capítulo 5OcultarOcultar detallesVer detallesJoins, Uniones y Consultas Avanzadas
Joins, Uniones y Consultas Avanzadas
Lección 1 • Skew Joins y Manejo de Sesgo de Datos
Aborda el sesgo de join causado por valores de clave de alta frecuencia que sobrecargan los reducers. La optimización de skew join distribuye las claves calientes entre múltiples tareas.
Lección 2 • Tipos y Sintaxis de Join
Cubre los joins INNER, LEFT, RIGHT, FULL OUTER y CROSS con sintaxis de HiveQL. Comprender la semántica de los joins previene conjuntos de resultados incorrectos.
Lección 3 • UNION, INTERSECT y EXCEPT
Enseña operaciones de conjunto para combinar y comparar conjuntos de resultados entre consultas. Estas operaciones soportan patrones de desduplicación y análisis diferencial.
Lección 4 • Map-Side y Broadcast Joins
Explica los map-side joins usando la sugerencia MAPJOIN para la optimización de tablas pequeñas. Los broadcast joins eliminan la sobrecarga de shuffle en joins de tablas grandes a pequeñas.
Lección 5 • Funciones de Ventana y Analíticas
Introduce OVER, PARTITION BY y ORDER BY para clasificación y agregaciones en ejecución. Las funciones de ventana permiten analíticas avanzadas sin colapsar la granularidad de las filas.
Capítulo 6OcultarOcultar detallesVer detallesTécnicas de Optimización de Consultas
Técnicas de Optimización de Consultas
Lección 1 • Comprensión del Plan de Ejecución de Consultas
Utiliza EXPLAIN y EXPLAIN EXTENDED para interpretar los planes de ejecución de MapReduce y Tez. Leer planes es la habilidad prerrequisito para todas las decisiones de optimización.
Lección 2 • Afinación del Motor de Ejecución Tez
Configura la ejecución de DAG de Tez para reducir la latencia en comparación con MapReduce. Tez es el motor recomendado para cargas de trabajo de Hive interactivas e iterativas.
Lección 3 • Poda de Particiones y Predicate Pushdown
Asegura que las consultas escaneen solo las particiones relevantes y empujen los filtros lo antes posible. Estas técnicas reducen la E/S, que es el costo dominante en las consultas de Hive.
Lección 4 • Optimización de Formato de Archivo y Compresión
Selecciona ORC y Parquet con códecs de compresión apropiados para minimizar el tiempo de escaneo. La compresión reduce tanto el costo de almacenamiento como la E/S de red durante la ejecución de la consulta.
Lección 5 • Vectorización y Optimizador Basado en Costos
Habilita la ejecución de consultas vectorizada y el optimizador basado en costos (CBO) para la mejora automática del plan. Ambos requieren la recopilación de estadísticas para funcionar correctamente.
Capítulo 7OcultarOcultar detallesVer detallesFunciones Definidas por el Usuario y Extensibilidad
Funciones Definidas por el Usuario y Extensibilidad
Lección 1 • Funciones de Tabla Definidas por el Usuario
Construye UDTFs que emiten múltiples filas desde una sola fila de entrada usando la interfaz UDTF. Las UDTFs soportan la explosión de estructuras anidadas y la generación de filas personalizadas.
Lección 2 • Funciones de Agregado Definidas por el Usuario
Implementa UDAFs usando las interfaces UDAF y GenericUDAF para agregaciones personalizadas. Las UDAFs operan a través de grupos de reducer y requieren gestión de buffer.
Lección 3 • Fundamentos del Desarrollo de UDFs
Cubre la clase base UDF, el método evaluate y el empaquetado JAR para funciones escalares simples. Las UDFs llenan los vacíos donde las funciones integradas son insuficientes.
Lección 4 • Transformaciones Basadas en Python y Scripts
Utiliza TRANSFORM y scripts de streaming para aplicar lógica de Python o shell dentro de HiveQL. Las transformaciones de script permiten la creación rápida de prototipos sin compilación Java.
Capítulo 8OcultarOcultar detallesVer detallesHive en Producción: Seguridad y Gobernanza
Hive en Producción: Seguridad y Gobernanza
Lección 1 • Gestión del Metastore y Alta Disponibilidad
Configura un metastore remoto con un backend relacional y configuración de alta disponibilidad. La confiabilidad del metastore es crítica para el servicio ininterrumpido de Hive en producción.
Lección 2 • Modelos de Autorización: SQL Standards y Ranger
Compara la autorización estándar SQL de Hive con el control basado en políticas de Apache Ranger. La autorización detallada aplica acceso con privilegios mínimos a nivel de columna.
Lección 3 • Autenticación e Integración con Kerberos
Configura la autenticación basada en Kerberos para HiveServer2 y conexiones de cliente. La autenticación previene el acceso no autorizado a activos de datos sensibles.
Lección 4 • Enmascaramiento de Datos y Cifrado
Aplica políticas dinámicas de enmascaramiento de datos y zonas de cifrado HDFS para proteger columnas sensibles. El enmascaramiento permite analíticas sobre datos sensibles sin exponer valores brutos.
Lección 5 • Auditoría y Registro de Cumplimiento
Habilita logs de auditoría de consultas a través de HiveServer2 y pistas de auditoría de Apache Ranger. Los logs de auditoría satisfacen los requisitos de cumplimiento regulatorio para el rastreo de acceso a datos.
Tu certificado válido de finalización
Este curso es para ti:
Analistas de datos listos para escalar sus habilidades más allá de las hojas de cálculo y SQL.
Ingenieros de software en transición a roles de big data y sistemas distribuidos.
Desarrolladores ETL que desean modernizar pipelines utilizando herramientas basadas en Hadoop.
Administradores de bases de datos que exploran el almacenamiento columnar y el ajuste de consultas a gran escala.
Profesionales de inteligencia de negocios cuyos conjuntos de datos han superado las bases de datos relacionales.
Ingenieros de cloud encargados de construir o migrar infraestructura de almacenes de datos.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en México?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















