Elige tu idioma
Curso de Apache Hive para Big Data
Más de 2 millones de estudiantes en todo el mundo

Curso de Apache Hive para Big Data

Domina Apache Hive desde cero — diseñando esquemas, escribiendo consultas HiveQL potentes y ajustando el rendimiento en conjuntos de datos masivos. Este curso cubre desde los fundamentos de HDFS y transacciones ACID hasta despliegue en la nube, seguridad y orquestación de flujos de trabajo. Ya sea que estés construyendo pipelines de datos empresariales u optimizando un data lakehouse, obtendrás las habilidades prácticas que los entornos de producción demandan.

Dedika para empresas

Lo que vas a aprender:

  • Diseña tablas Hive administradas y externas con particionado, bucketing y formatos de almacenamiento en columnas.

  • Escribe consultas HiveQL avanzadas usando funciones de ventana, CTEs, subconsultas y joins de múltiples tablas.

  • Optimiza la ejecución de consultas aplicando poda de particiones, vectorización y ajuste del optimizador basado en costos.

  • Implementa seguridad en Hive usando autenticación Kerberos, políticas de Apache Ranger y enmascaramiento dinámico de datos.

  • Integra Hive con Apache Spark, almacenamiento de objetos en la nube y formatos de tabla abiertos como Apache Iceberg.

  • Automatiza pipelines de datos con Apache Airflow y Oozie, incluyendo carga incremental y verificaciones de calidad.

Cómo estudias de forma práctica Curso de Apache Hive para Big Data

Cómo practicas Curso de Apache Hive para Big Data

Para ti que tienes una empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Introducción a Big Data y Hive

  • Lección 1 • Arquitectura y Componentes de Hive

    Explica los componentes principales de Hive: metastore, driver, compilador y motor de ejecución. Conecta la arquitectura con la comprensión del ciclo de vida de las consultas.

  • Lección 2 • Fundamentos y Desafíos de Big Data

    Cubre los desafíos de volumen, velocidad y variedad que impulsan la adopción de big data. Establece el contexto de por qué existen herramientas de procesamiento distribuido como Hive.

  • Lección 3 • Configuración de un Entorno Hive

    Guía la instalación y configuración de un entorno Hive local o sandbox. Proporciona preparación práctica para todos los capítulos siguientes.

  • Lección 4 • Hive vs. Bases de Datos Tradicionales

    Contrasta el modelo de esquema en lectura de Hive con el esquema en escritura de un RDBMS. Los estudiantes entienden cuándo Hive es apropiado versus las alternativas relacionales.

Capítulo 2Ver detalles

Fundamentos de HiveQL y Tipos de Datos

  • Lección 1 • Tipos de Datos Primitivos y Complejos

    Cubre los primitivos numéricos, de cadena, booleanos y de fecha junto con los tipos complejos ARRAY, MAP y STRUCT. La selección correcta del tipo afecta el almacenamiento y la precisión de las consultas.

  • Lección 2 • Sintaxis de HiveQL y Estructura de Consultas

    Presenta HiveQL como un dialecto SQL con extensiones específicas de Hive. Cubre las cláusulas SELECT, FROM, WHERE y ORDER BY como bloques de construcción.

  • Lección 3 • Agregación y Agrupamiento

    Enseña GROUP BY, HAVING y funciones de agregado para resumir conjuntos de datos. La agregación es fundamental para los patrones de consultas analíticas utilizados a lo largo del curso.

  • Lección 4 • Subconsultas y Expresiones de Tabla Comunes

    Introduce vistas en línea, subconsultas y CTEs con la cláusula WITH para un diseño de consultas modular. Estos patrones aparecen en consultas analíticas complejas en capítulos posteriores.

  • Lección 5 • Funciones Integradas y Operadores

    Revisa funciones integradas de cadena, matemáticas, fecha y condicionales. Los estudiantes aplican funciones para transformar y evaluar datos dentro de las consultas.

Capítulo 3Ver detalles

Diseño de Bases de Datos y Tablas en Hive

  • Lección 1 • Particionado de Tablas

    Enseña el particionado estático y dinámico para reducir los escaneos completos de tabla. El particionado es la técnica principal para mejorar el rendimiento de las consultas en tablas grandes.

  • Lección 2 • Creación y Administración de Bases de Datos

    Cubre CREATE DATABASE, DROP DATABASE y las propiedades de la base de datos. Una organización adecuada de la base de datos apoya la gobernanza de datos multi-equipo.

  • Lección 3 • Formatos de Almacenamiento de Tablas

    Compara los formatos de almacenamiento TextFile, SequenceFile, ORC y Parquet. La elección del formato impacta directamente en la velocidad de consulta y la eficiencia del almacenamiento.

  • Lección 4 • Tablas Administradas vs. Externas

    Distingue las tablas administradas (datos propiedad de Hive) de las tablas externas (datos propiedad del usuario). Elegir correctamente previene la pérdida accidental de datos.

  • Lección 5 • Bucketing y Clustering

    Introduce el bucketing como complemento del particionado para una distribución uniforme de datos. Las tablas bucketeadas permiten un muestreo eficiente y la optimización de joins.

Capítulo 4Ver detalles

Carga, Inserción y Administración de Datos

  • Lección 1 • Carga de Datos desde Archivos

    Cubre LOAD DATA LOCAL y LOAD DATA desde rutas HDFS. La carga basada en archivos es el patrón de ingesta inicial más común en los flujos de trabajo de Hive.

  • Lección 2 • Transacciones ACID y Operaciones CRUD

    Explica el soporte ACID de Hive que permite UPDATE y DELETE en tablas ORC. Las operaciones ACID requieren configuración y propiedades de tabla específicas.

  • Lección 3 • Patrones de INSERT e INSERT OVERWRITE

    Enseña INSERT INTO e INSERT OVERWRITE para la población de datos basada en consultas. Estos patrones soportan pipelines de ETL construidos completamente dentro de HiveQL.

  • Lección 4 • Exportación y Archivado de Datos

    Cubre los comandos INSERT OVERWRITE DIRECTORY y EXPORT/IMPORT. La exportación de datos apoya el consumo downstream y la migración entre clústeres.

Capítulo 5Ver detalles

Joins, Uniones y Consultas Avanzadas

  • Lección 1 • Skew Joins y Manejo de Sesgo de Datos

    Aborda el sesgo de join causado por valores de clave de alta frecuencia que sobrecargan los reducers. La optimización de skew join distribuye las claves calientes entre múltiples tareas.

  • Lección 2 • Tipos y Sintaxis de Join

    Cubre los joins INNER, LEFT, RIGHT, FULL OUTER y CROSS con sintaxis de HiveQL. Comprender la semántica de los joins previene conjuntos de resultados incorrectos.

  • Lección 3 • UNION, INTERSECT y EXCEPT

    Enseña operaciones de conjunto para combinar y comparar conjuntos de resultados entre consultas. Estas operaciones soportan patrones de desduplicación y análisis diferencial.

  • Lección 4 • Map-Side y Broadcast Joins

    Explica los map-side joins usando la sugerencia MAPJOIN para la optimización de tablas pequeñas. Los broadcast joins eliminan la sobrecarga de shuffle en joins de tablas grandes a pequeñas.

  • Lección 5 • Funciones de Ventana y Analíticas

    Introduce OVER, PARTITION BY y ORDER BY para clasificación y agregaciones en ejecución. Las funciones de ventana permiten analíticas avanzadas sin colapsar la granularidad de las filas.

Capítulo 6Ver detalles

Técnicas de Optimización de Consultas

  • Lección 1 • Comprensión del Plan de Ejecución de Consultas

    Utiliza EXPLAIN y EXPLAIN EXTENDED para interpretar los planes de ejecución de MapReduce y Tez. Leer planes es la habilidad prerrequisito para todas las decisiones de optimización.

  • Lección 2 • Afinación del Motor de Ejecución Tez

    Configura la ejecución de DAG de Tez para reducir la latencia en comparación con MapReduce. Tez es el motor recomendado para cargas de trabajo de Hive interactivas e iterativas.

  • Lección 3 • Poda de Particiones y Predicate Pushdown

    Asegura que las consultas escaneen solo las particiones relevantes y empujen los filtros lo antes posible. Estas técnicas reducen la E/S, que es el costo dominante en las consultas de Hive.

  • Lección 4 • Optimización de Formato de Archivo y Compresión

    Selecciona ORC y Parquet con códecs de compresión apropiados para minimizar el tiempo de escaneo. La compresión reduce tanto el costo de almacenamiento como la E/S de red durante la ejecución de la consulta.

  • Lección 5 • Vectorización y Optimizador Basado en Costos

    Habilita la ejecución de consultas vectorizada y el optimizador basado en costos (CBO) para la mejora automática del plan. Ambos requieren la recopilación de estadísticas para funcionar correctamente.

Capítulo 7Ver detalles

Funciones Definidas por el Usuario y Extensibilidad

  • Lección 1 • Funciones de Tabla Definidas por el Usuario

    Construye UDTFs que emiten múltiples filas desde una sola fila de entrada usando la interfaz UDTF. Las UDTFs soportan la explosión de estructuras anidadas y la generación de filas personalizadas.

  • Lección 2 • Funciones de Agregado Definidas por el Usuario

    Implementa UDAFs usando las interfaces UDAF y GenericUDAF para agregaciones personalizadas. Las UDAFs operan a través de grupos de reducer y requieren gestión de buffer.

  • Lección 3 • Fundamentos del Desarrollo de UDFs

    Cubre la clase base UDF, el método evaluate y el empaquetado JAR para funciones escalares simples. Las UDFs llenan los vacíos donde las funciones integradas son insuficientes.

  • Lección 4 • Transformaciones Basadas en Python y Scripts

    Utiliza TRANSFORM y scripts de streaming para aplicar lógica de Python o shell dentro de HiveQL. Las transformaciones de script permiten la creación rápida de prototipos sin compilación Java.

Capítulo 8Ver detalles

Hive en Producción: Seguridad y Gobernanza

  • Lección 1 • Gestión del Metastore y Alta Disponibilidad

    Configura un metastore remoto con un backend relacional y configuración de alta disponibilidad. La confiabilidad del metastore es crítica para el servicio ininterrumpido de Hive en producción.

  • Lección 2 • Modelos de Autorización: SQL Standards y Ranger

    Compara la autorización estándar SQL de Hive con el control basado en políticas de Apache Ranger. La autorización detallada aplica acceso con privilegios mínimos a nivel de columna.

  • Lección 3 • Autenticación e Integración con Kerberos

    Configura la autenticación basada en Kerberos para HiveServer2 y conexiones de cliente. La autenticación previene el acceso no autorizado a activos de datos sensibles.

  • Lección 4 • Enmascaramiento de Datos y Cifrado

    Aplica políticas dinámicas de enmascaramiento de datos y zonas de cifrado HDFS para proteger columnas sensibles. El enmascaramiento permite analíticas sobre datos sensibles sin exponer valores brutos.

  • Lección 5 • Auditoría y Registro de Cumplimiento

    Habilita logs de auditoría de consultas a través de HiveServer2 y pistas de auditoría de Apache Ranger. Los logs de auditoría satisfacen los requisitos de cumplimiento regulatorio para el rastreo de acceso a datos.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Analistas de datos listos para escalar sus habilidades más allá de las hojas de cálculo y SQL.

  • Ingenieros de software en transición a roles de big data y sistemas distribuidos.

  • Desarrolladores ETL que desean modernizar pipelines utilizando herramientas basadas en Hadoop.

  • Administradores de bases de datos que exploran el almacenamiento columnar y el ajuste de consultas a gran escala.

  • Profesionales de inteligencia de negocios cuyos conjuntos de datos han superado las bases de datos relacionales.

  • Ingenieros de cloud encargados de construir o migrar infraestructura de almacenes de datos.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en México?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF