Elige tu idioma
Curso de Apache Hive para Big Data
Más de 2 millones de estudiantes en todo el mundo

Curso de Apache Hive para Big Data

Domina Apache Hive desde cero: diseña esquemas, escribe consultas potentes en HiveQL y ajusta el rendimiento en conjuntos de datos masivos. Este curso cubre desde los fundamentos de HDFS y las transacciones ACID hasta el despliegue en la nube, la seguridad y la orquestación de flujos de trabajo. Tanto si estás construyendo canalizaciones de datos empresariales como optimizando un data lakehouse, adquirirás las competencias prácticas que exigen los entornos de producción.

Dedika para empresas

Lo que vas a aprender:

  • Diseña tablas Hive gestionadas y externas con particionamiento, bucketing y formatos de almacenamiento columnar.

  • Escribe consultas avanzadas en HiveQL utilizando funciones de ventana, CTE, subconsultas y uniones de múltiples tablas.

  • Optimiza la ejecución de consultas aplicando poda de particiones, vectorización y ajuste del optimizador basado en costes.

  • Aplica seguridad en Hive mediante autenticación Kerberos, políticas de Apache Ranger y enmascaramiento dinámico de datos.

  • Integra Hive con Apache Spark, almacenamiento de objetos en la nube y formatos de tabla abiertos como Apache Iceberg.

  • Automatiza canalizaciones de datos con Apache Airflow y Oozie, incluyendo carga incremental y verificaciones de calidad.

Cómo estudias de forma práctica Curso de Apache Hive para Big Data

Cómo practicas Curso de Apache Hive para Big Data

Para ti que eres empresa y quieres formar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Introducción al Big Data y Hive

  • Lección 1 • Arquitectura y Componentes de Hive

    Explica los componentes principales de Hive: metastore, driver, compilador y motor de ejecución. Conecta la arquitectura con la comprensión del ciclo de vida de las consultas.

  • Lección 2 • Fundamentos y Retos del Big Data

    Cubre los retos de volumen, velocidad y variedad que impulsan la adopción del big data. Establece el contexto de por qué existen herramientas de procesamiento distribuido como Hive.

  • Lección 3 • Configuración de un Entorno Hive

    Guía la instalación y configuración de un entorno Hive local o en un entorno aislado. Proporciona preparación práctica para todos los capítulos siguientes.

  • Lección 4 • Hive vs. Bases de Datos Tradicionales

    Contrasta el modelo de esquema en lectura de Hive con el esquema en escritura de los SGBDR. Los estudiantes comprenden cuándo es apropiado Hive frente a las alternativas relacionales.

Capítulo 2Ver detalles

Fundamentos de HiveQL y Tipos de Datos

  • Lección 1 • Tipos de Datos Primitivos y Complejos

    Cubre los primitivos numéricos, de cadena, booleanos y de fecha, junto con los tipos complejos ARRAY, MAP y STRUCT. La selección correcta del tipo afecta al almacenamiento y la precisión de las consultas.

  • Lección 2 • Sintaxis de HiveQL y Estructura de las Consultas

    Presenta HiveQL como un dialecto SQL con extensiones específicas de Hive. Cubre las cláusulas SELECT, FROM, WHERE y ORDER BY como bloques fundamentales.

  • Lección 3 • Agregación y Agrupamiento

    Enseña GROUP BY, HAVING y funciones de agregación para resumir conjuntos de datos. La agregación es fundamental para los patrones de consulta analíticos utilizados a lo largo del curso.

  • Lección 4 • Subconsultas y Expresiones de Tabla Comunes

    Introduce las vistas en línea, las subconsultas y las CTE con la cláusula WITH para un diseño modular de consultas. Estos patrones aparecen en consultas analíticas complejas en capítulos posteriores.

  • Lección 5 • Funciones Integradas y Operadores

    Examina las funciones integradas de cadena, matemáticas, fecha y condicionales. Los estudiantes aplican funciones para transformar y evaluar datos dentro de las consultas.

Capítulo 3Ver detalles

Diseño de Bases de Datos y Tablas en Hive

  • Lección 1 • Particionamiento de Tablas

    Enseña el particionamiento estático y dinámico para reducir los escaneos completos de tabla. El particionamiento es la técnica principal para mejorar el rendimiento de las consultas en tablas grandes.

  • Lección 2 • Creación y Gestión de Bases de Datos

    Cubre CREATE DATABASE, DROP DATABASE y las propiedades de las bases de datos. Una organización adecuada de las bases de datos respalda la gobernanza de datos entre múltiples equipos.

  • Lección 3 • Formatos de Almacenamiento de Tablas

    Compara los formatos de almacenamiento TextFile, SequenceFile, ORC y Parquet. La elección del formato impacta directamente en la velocidad de consulta y la eficiencia del almacenamiento.

  • Lección 4 • Tablas Gestionadas vs. Externas

    Distingue las tablas gestionadas (datos propiedad de Hive) de las tablas externas (datos propiedad del usuario). Elegir correctamente previene la pérdida accidental de datos.

  • Lección 5 • Bucketing y Agrupación en Clústeres

    Introduce el bucketing como complemento al particionamiento para una distribución uniforme de los datos. Las tablas agrupadas en buckets permiten un muestreo eficiente y la optimización de joins.

Capítulo 4Ver detalles

Carga, Inserción y Gestión de Datos

  • Lección 1 • Carga de Datos desde Archivos

    Cubre LOAD DATA LOCAL y LOAD DATA desde rutas HDFS. La carga basada en archivos es el patrón de ingesta inicial más común en los flujos de trabajo de Hive.

  • Lección 2 • Transacciones ACID y Operaciones CRUD

    Explica el soporte ACID de Hive que permite UPDATE y DELETE en tablas ORC. Las operaciones ACID requieren una configuración y propiedades de tabla específicas.

  • Lección 3 • Patrones INSERT e INSERT OVERWRITE

    Enseña INSERT INTO e INSERT OVERWRITE para la población de datos basada en consultas. Estos patrones soportan canalizaciones ETL construidas enteramente dentro de HiveQL.

  • Lección 4 • Exportación y Archivado de Datos

    Cubre los comandos INSERT OVERWRITE DIRECTORY y EXPORT/IMPORT. La exportación de datos soporta el consumo posterior y la migración entre clústeres.

Capítulo 5Ver detalles

Joins, Uniones y Consultas Avanzadas

  • Lección 1 • Skew Joins y Manejo del Sesgo de Datos

    Aborda el sesgo en joins causado por valores de clave de alta frecuencia que sobrecargan los reductores. La optimización de skew join distribuye las claves calientes entre múltiples tareas.

  • Lección 2 • Tipos de Join y Sintaxis

    Cubre los joins INNER, LEFT, RIGHT, FULL OUTER y CROSS con sintaxis HiveQL. Comprender la semántica de los joins previene conjuntos de resultados incorrectos.

  • Lección 3 • UNION, INTERSECT y EXCEPT

    Enseña operaciones de conjuntos para combinar y comparar conjuntos de resultados entre consultas. Estas operaciones soportan patrones de deduplicación y análisis diferencial.

  • Lección 4 • Map-Side Joins y Broadcast Joins

    Explica los map-side joins usando la sugerencia MAPJOIN para la optimización de tablas pequeñas. Los broadcast joins eliminan la sobrecarga de la mezcla en joins de tablas grandes con pequeñas.

  • Lección 5 • Funciones de Ventana y Analíticas

    Introduce OVER, PARTITION BY y ORDER BY para ranking y agregaciones continuas. Las funciones de ventana permiten analíticas avanzadas sin colapsar la granularidad de las filas.

Capítulo 6Ver detalles

Técnicas de Optimización de Consultas

  • Lección 1 • Comprensión del Plan de Ejecución de Consultas

    Utiliza EXPLAIN y EXPLAIN EXTENDED para interpretar los planes de ejecución de MapReduce y Tez. Leer los planes es la habilidad previa necesaria para todas las decisiones de optimización.

  • Lección 2 • Ajuste del Motor de Ejecución Tez

    Configura la ejecución DAG de Tez para una latencia reducida en comparación con MapReduce. Tez es el motor recomendado para cargas de trabajo interactivas e iterativas de Hive.

  • Lección 3 • Poda de Particiones y Predicado Pushdown

    Asegura que las consultas escaneen solo las particiones relevantes y empujen los filtros lo antes posible. Estas técnicas reducen la E/S, que es el coste dominante en las consultas de Hive.

  • Lección 4 • Optimización del Formato de Archivo y Compresión

    Selecciona ORC y Parquet con códecs de compresión apropiados para minimizar el tiempo de escaneo. La compresión reduce tanto el coste de almacenamiento como la E/S de red durante la ejecución de consultas.

  • Lección 5 • Vectorización y Optimizador Basado en Costes

    Habilita la ejecución de consultas vectorizada y el optimizador basado en costes (CBO) para la mejora automática de planes. Ambos requieren la recopilación de estadísticas para funcionar correctamente.

Capítulo 7Ver detalles

Funciones Definidas por el Usuario y Extensibilidad

  • Lección 1 • Funciones de Tabla Definidas por el Usuario

    Construye UDTF que emiten múltiples filas a partir de una sola fila de entrada usando la interfaz UDTF. Las UDTF soportan la expansión de estructuras anidadas y la generación de filas personalizadas.

  • Lección 2 • Funciones de Agregación Definidas por el Usuario

    Implementa UDAF usando las interfaces UDAF y GenericUDAF para agregaciones personalizadas. Las UDAF operan entre grupos de reducción y requieren gestión de búferes.

  • Lección 3 • Fundamentos del Desarrollo de UDF

    Cubre la clase base UDF, el método evaluate y el empaquetado JAR para funciones escalares simples. Las UDF llenan los vacíos donde las funciones integradas son insuficientes.

  • Lección 4 • Transformaciones Basadas en Python y Scripts

    Utiliza TRANSFORM y scripts de streaming para aplicar lógica de Python o shell dentro de HiveQL. Las transformaciones de script permiten la creación rápida de prototipos sin compilación Java.

Capítulo 8Ver detalles

Hive en Producción: Seguridad y Gobernanza

  • Lección 1 • Gestión del Metastore y Alta Disponibilidad

    Configura un metastore remoto con un backend relacional y una configuración de alta disponibilidad. La fiabilidad del metastore es crítica para un servicio Hive ininterrumpido en producción.

  • Lección 2 • Modelos de Autorización: Estándares SQL y Ranger

    Compara la autorización estándar SQL de Hive con el control basado en políticas de Apache Ranger. La autorización detallada impone el acceso con privilegios mínimos a nivel de columna.

  • Lección 3 • Autenticación e Integración con Kerberos

    Configura la autenticación basada en Kerberos para HiveServer2 y las conexiones de cliente. La autenticación previene el acceso no autorizado a activos de datos sensibles.

  • Lección 4 • Enmascaramiento y Cifrado de Datos

    Aplica políticas dinámicas de enmascaramiento de datos y zonas de cifrado HDFS para proteger columnas sensibles. El enmascaramiento permite analíticas sobre datos sensibles sin exponer los valores brutos.

  • Lección 5 • Auditoría y Registro de Cumplimiento

    Habilita los registros de auditoría de consultas a través de HiveServer2 y las pistas de auditoría de Apache Ranger. Los registros de auditoría satisfacen los requisitos de cumplimiento normativo para el seguimiento del acceso a datos.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Analistas de datos preparados para llevar sus competencias más allá de las hojas de cálculo y SQL.

  • Ingenieros de software en transición hacia roles de big data y sistemas distribuidos.

  • Desarrolladores de ETL que desean modernizar sus canalizaciones con herramientas basadas en Hadoop.

  • Administradores de bases de datos que exploran el almacenamiento columnar y el ajuste de consultas a gran escala.

  • Profesionales de inteligencia de negocio cuyos conjuntos de datos han superado las bases de datos relacionales.

  • Ingenieros de la nube encargados de construir o migrar infraestructura de almacén de datos.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacéis, ya os he recomendado a otras personas...
Giulio Carlo
Giulio CarloAlumno de Marketing Digital
Me gusta cómo las lecciones van directas al grano y cómo puedo cambiar de capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresAlumna de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de vídeos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaAlumna de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los vídeos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeAlumno de Ingeniería de Prompts

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en España?

¿Los cursos son gratuitos?

¿Cuál es la carga lectiva del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el coste o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF