
Curso de cloud data engineer
Domine el stack completo de ingeniería de datos en la nube, desde el almacenamiento y la ingesta hasta el procesamiento en tiempo real y las operaciones en producción. Este curso le brinda las competencias prácticas para diseñar plataformas de datos escalables, implementar marcos de gobernanza y operar pipelines confiables. Desarrolle la experiencia que exigen los roles modernos de ingeniería de datos.
Lo que vas a aprender:
Usted aprenderá a diseñar y gestionar plataformas de datos en la nube usando herramientas y marcos de trabajo estándar de la industria. El curso cubre los fundamentos de la infraestructura en la nube, sistemas de almacenamiento relacional y NoSQL, patrones de ingesta por lotes y en tiempo real, y procesamiento distribuido con Apache Spark. Usted implementará validación de calidad de datos, seguimiento de linaje y prácticas de observabilidad para mantener los pipelines confiables en producción. Los temas avanzados incluyen transmisión en tiempo real con Apache Flink, Infraestructura como Código, flujos de trabajo DataOps y arquitecturas modernas como el lakehouse y la malla de datos. También adquirirá competencias prácticas en Python, optimización de SQL e integración de pipelines de aprendizaje automático.
Cómo estudias de forma práctica Curso de cloud data engineer
Cómo practicas Curso de cloud data engineer
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de Computación en la Nube para Ingenieros de Datos
Fundamentos de Computación en la Nube para Ingenieros de Datos
Lección 1 • Modelos de Servicio en la Nube y Tipos de Despliegue
Cubre las distinciones entre IaaS, PaaS y SaaS junto con despliegues públicos, privados e híbridos. Fundamenta todas las decisiones posteriores sobre servicios de datos en la nube en un contexto arquitectónico.
Lección 2 • Componentes Básicos de Infraestructura en la Nube
Presenta los elementos primitivos de cómputo, almacenamiento, redes e identidad utilizados en las principales plataformas de nube. Proporciona el vocabulario necesario para diseñar y discutir infraestructura de datos.
Lección 3 • Fundamentos de Seguridad y Cumplimiento en la Nube
Cubre el cifrado en reposo y en tránsito, la gestión de claves y los marcos de cumplimiento regulatorio para datos. Establece hábitos de seguridad que se aplican a lo largo del curso.
Lección 4 • Fundamentos de Precios y Gestión de Costos en la Nube
Explica los precios de pago por uso, capacidad reservada y modelos de precios spot relevantes para cargas de trabajo de datos. Permite tomar decisiones de arquitectura conscientes de los costos desde el principio.
Capítulo 2OcultarOcultar detallesVer detallesSistemas de Almacenamiento de Datos en la Nube
Sistemas de Almacenamiento de Datos en la Nube
Lección 1 • Elegir el Almacenamiento Adecuado para Cada Caso de Uso
Aplica un marco de decisión para hacer coincidir los sistemas de almacenamiento con los requisitos de latencia, rendimiento y costo. Sintetiza todas las opciones de almacenamiento en una guía práctica de selección.
Lección 2 • Opciones NoSQL y de Almacén Clave-Valor
Cubre modelos de bases de datos documentales, de columna ancha, clave-valor y de grafos disponibles como servicios en la nube. Orienta la selección según patrones de acceso y requisitos de consistencia.
Lección 3 • Servicios de Bases de Datos Relacionales en la Nube
Examina ofertas de bases de datos relacionales administradas, configuraciones de alta disponibilidad y réplicas de lectura. Conecta los fundamentos de SQL con patrones de despliegue administrados en la nube.
Lección 4 • Bodegas de Datos como Servicio en la Nube
Presenta el almacenamiento columnar, la arquitectura MPP y el aprovisionamiento y escalamiento de bodegas de datos en la nube. Prepara a los estudiantes para las cargas de trabajo de consultas analíticas cubiertas en capítulos posteriores.
Lección 5 • Almacenamiento de Objetos y Lagos de Datos
Explica la arquitectura de almacenamiento de objetos, políticas de depósito, reglas de ciclo de vida y patrones de organización de lagos de datos. Constituye la base para todo el trabajo de ingesta y almacenamiento de datos a gran escala.
Capítulo 3OcultarOcultar detallesVer detallesFundamentos de Ingesta de Datos y Pipelines
Fundamentos de Ingesta de Datos y Pipelines
Lección 1 • Patrones y Herramientas de Ingesta por Lotes
Cubre transferencias de archivos programadas, ingesta masiva por API y estrategias de carga incremental para pipelines por lotes. Establece el patrón de ingesta más común antes de introducir el flujo continuo.
Lección 2 • Técnicas de Captura de Datos de Cambio
Explica métodos de CDC basados en logs, disparadores y marcas de tiempo para capturar cambios en bases de datos. Permite la replicación casi en tiempo real sin escaneos completos de tabla.
Lección 3 • Fundamentos de Ingesta en Flujo
Presenta conceptos de flujo de eventos, productores, consumidores, temas y particiones para el flujo de datos en tiempo real. Conecta el conocimiento de ingesta por lotes con el procesamiento continuo de datos.
Lección 4 • Fundamentos de Orquestación de Pipelines
Cubre orquestación basada en DAG, dependencias de tareas, reintentos y alertas para la gestión de pipelines de datos. Proporciona la columna vertebral operativa para todos los tipos de pipelines construidos en este curso.
Capítulo 4OcultarOcultar detallesVer detallesTransformación y Procesamiento de Datos a Escala
Transformación y Procesamiento de Datos a Escala
Lección 1 • Orquestación de Flujos de Trabajo de Transformación
Aplica herramientas de orquestación para programar, monitorear y versionar trabajos de transformación a escala. Extiende los fundamentos de orquestación de pipelines a flujos de trabajo de transformación complejos de múltiples pasos.
Lección 2 • Modelado de Datos para Analítica
Presenta el esquema estrella, el esquema copo de nieve y el modelado de bóveda de datos para cargas de trabajo analíticas. Asegura que los resultados de transformación estén estructurados para consultas posteriores eficientes.
Lección 3 • Patrones de Transformación Basados en SQL
Cubre funciones de ventana, CTEs, modelos incrementales y optimización de consultas para transformaciones SQL a gran escala. Conecta las habilidades de SQL con motores de consulta de bodega de datos y lago en la nube.
Lección 4 • Procesamiento Distribuido por Lotes con Spark
Enseña APIs de RDD y DataFrame, particionamiento, barajado y optimización de trabajos en Apache Spark. Establece el motor principal de procesamiento distribuido utilizado a lo largo del curso.
Lección 5 • Ajuste de Rendimiento para Trabajos a Gran Escala
Aborda el almacenamiento en caché, las uniones broadcast, la selección de formato de archivo y el dimensionamiento de clústeres para el rendimiento de transformación. Prepara a los estudiantes para diagnosticar y resolver cuellos de botella en pipelines de producción.
Capítulo 5OcultarOcultar detallesVer detallesProcesamiento de Datos en Flujo y Pipelines en Tiempo Real
Procesamiento de Datos en Flujo y Pipelines en Tiempo Real
Lección 1 • Ventanas y Semántica de Tiempo
Cubre ventanas saltatorias, deslizantes y de sesión junto con tiempo de evento, tiempo de procesamiento y marcas de agua. Permite agregaciones precisas sobre flujos de eventos fuera de orden y de llegada tardía.
Lección 2 • Patrones de Diseño de Pipelines de Flujo
Aplica arquitecturas lambda, kappa y de flujo prioritario a escenarios de ingeniería de datos del mundo real. Conecta el conocimiento de marcos con decisiones de diseño de pipelines de extremo a extremo.
Lección 3 • Procesamiento de Flujo con Estado
Explica el estado con clave, el estado de operador, la creación de puntos de control y los backends de estado para trabajos de flujo tolerantes a fallos. Permite la detección de eventos complejos y agregaciones continuas en flujos ilimitados.
Lección 4 • Descripción General de Marcos de Procesamiento de Flujo
Compara Apache Flink, Spark Structured Streaming y servicios de flujo administrados en la nube por capacidad. Orienta la selección del marco según los requisitos de latencia, estado y operación.
Capítulo 6OcultarOcultar detallesVer detallesCalidad de Datos, Gobernanza y Observabilidad
Calidad de Datos, Gobernanza y Observabilidad
Lección 1 • Contratos de Datos y Gestión de Esquemas
Define contratos de datos entre productores y consumidores y cubre el uso y evolución del registro de esquemas. Previene que los cambios disruptivos se propaguen a través de los sistemas de datos dependientes.
Lección 2 • Marcos de Validación de Calidad de Datos
Cubre validación de esquemas, comprobaciones de nulos, integridad referencial y perfilamiento estadístico para la calidad de datos. Integra compuertas de calidad directamente en los pipelines de ingesta y transformación.
Lección 3 • Linaje de Datos y Catalogación
Explica el linaje a nivel de columna, la catalogación de metadatos y las herramientas de descubrimiento de datos para el cumplimiento de gobernanza. Permite a los equipos rastrear los orígenes de los datos y comprender el impacto posterior de los cambios.
Lección 4 • Observabilidad y Monitoreo de Pipelines
Presenta métricas, registros, trazas y seguimiento de SLA para el monitoreo integral del estado de los pipelines. Proporciona la visibilidad operativa necesaria para mantener los sistemas de datos en producción de manera confiable.
Lección 5 • Control de Acceso a Datos y Privacidad
Cubre el acceso basado en roles, la seguridad a nivel de fila, el enmascaramiento de datos y técnicas de preservación de privacidad para datos sensibles. Alinea los patrones de acceso a datos con los requisitos regulatorios y organizacionales.
Capítulo 7OcultarOcultar detallesVer detallesArquitectura y Diseño de Plataformas de Datos en la Nube
Arquitectura y Diseño de Plataformas de Datos en la Nube
Lección 1 • Diseño para Entornos Multi-Nube e Híbridos
Cubre la portabilidad de datos, las redes entre nubes y las herramientas neutrales de proveedor para plataformas de datos multi-nube. Prepara a los estudiantes para diseñar plataformas que eviten la dependencia de un solo proveedor.
Lección 2 • Patrones de Escalabilidad y Confiabilidad
Aborda el escalamiento horizontal, la tolerancia a fallos, la idempotencia y la recuperación ante desastres para componentes de plataformas de datos. Asegura que los diseños de plataformas cumplan con los requisitos de confiabilidad y disponibilidad en producción.
Lección 3 • Estrategias de Optimización de Costos de Plataforma
Aplica el dimensionamiento correcto, el uso de instancias spot, la jerarquización de almacenamiento y los controles de costos de consultas para reducir el gasto de la plataforma. Conecta las decisiones arquitectónicas directamente con resultados de costos medibles.
Lección 4 • Arquitecturas de Referencia de Plataformas de Datos Modernas
Examina las arquitecturas medallón, malla de datos y lakehouse como modelos para plataformas de datos en la nube. Proporciona el vocabulario y los patrones arquitectónicos para los ejercicios de diseño que siguen.
Lección 5 • Infraestructura como Código para Plataformas de Datos
Cubre el aprovisionamiento declarativo de infraestructura, módulos, gestión de estado y CI/CD para recursos de datos en la nube. Permite el despliegue repetible y con control de versiones de todos los componentes de infraestructura de datos.
Capítulo 8OcultarOcultar detallesVer detallesDataOps, Despliegue y Operaciones de Producción
DataOps, Despliegue y Operaciones de Producción
Lección 1 • Planificación de Capacidad y Gestión del Rendimiento
Aplica pruebas de carga, previsión de recursos y evaluaciones comparativas de rendimiento a las decisiones de capacidad de la plataforma de datos. Asegura que las plataformas escalen de manera proactiva y no reactiva bajo volúmenes de datos crecientes.
Lección 2 • Cultura DataOps y Mejora Continua
Presenta los principios de DataOps, bucles de retroalimentación, versionamiento de pipelines y prácticas de colaboración en equipo. Integra una mentalidad de mejora continua en las operaciones diarias de ingeniería de datos.
Lección 3 • Gestión de Entornos y Configuración
Cubre la paridad de entornos de desarrollo, pruebas y producción, la gestión de secretos y las configuraciones específicas del entorno. Previene la deriva de configuración y la exposición de credenciales en los entornos de despliegue.
Lección 4 • Pipelines de CI/CD para Ingeniería de Datos
Construye flujos de trabajo de pruebas automatizadas, análisis estático, despliegue y reversión para código de pipelines de datos. Aplica prácticas de entrega de ingeniería de software al ciclo de vida de la ingeniería de datos.
Lección 5 • Respuesta a Incidentes para Sistemas de Datos
Define niveles de severidad de incidentes, manuales, análisis de causa raíz y procesos post mortem para interrupciones de datos. Construye la disciplina operativa necesaria para mantener los SLA de datos bajo condiciones de fallo.
Tu certificado válido de finalización
Este curso es para ti:
Analista de datos: listo para moverse hacia arriba y ser dueño de los pipelines que alimentan sus informes.
Ingeniero de software: desea especializarse en infraestructura de datos y trabajo con sistemas distribuidos.
Desarrollador de BI: busca expandirse más allá de los tableros hacia la ingeniería de plataformas de datos escalables.
Ingeniero de datos junior: busca un plan de estudios estructurado para cerrar brechas críticas de conocimiento rápidamente.
Desarrollador backend: en transición hacia roles de datos nativos de la nube en empresas impulsadas por datos.
Ingeniero de analítica: apunta a profundizar su experiencia en ingesta, transmisión y operaciones de producción.
Lo que dicen nuestros estudiantes
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Colombia?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















