Elige tu idioma
Curso de cloud data engineer
Más de 2 millones de estudiantes en todo el mundo

Curso de cloud data engineer

Dominá el stack completo de ingeniería de datos en la nube, desde almacenamiento e ingesta hasta procesamiento en tiempo real y operaciones de producción. Este curso te da las habilidades prácticas para diseñar plataformas de datos escalables, implementar marcos de gobernanza y operar pipelines confiables. Construí la experiencia que exigen los roles modernos de ingeniería de datos.

Dedika para empresas

Qué vas a aprender:

Vas a aprender a diseñar y gestionar plataformas de datos en la nube usando herramientas y frameworks estándar de la industria. El curso cubre fundamentos de infraestructura en la nube, sistemas de almacenamiento relacionales y NoSQL, patrones de ingesta batch y streaming, y procesamiento distribuido con Apache Spark. Vas a implementar validación de calidad de datos, seguimiento de linaje y prácticas de observabilidad para mantener los pipelines confiables en producción. Los temas avanzados incluyen streaming en tiempo real con Apache Flink, Infraestructura como Código, flujos de trabajo de DataOps y arquitecturas modernas como el lakehouse y el data mesh. También vas a adquirir habilidades prácticas en Python, optimización de SQL e integración de pipelines de ML.

Cómo estudiás de forma práctica Curso de cloud data engineer

Cómo practicás Curso de cloud data engineer

Para vos que sos empresa y querés capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Hacé clic acá

Contenido del curso

8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de Computación en la Nube para Ingenieros de Datos

  • Lección 1 • Modelos de Servicio en la Nube y Tipos de Despliegue

    Abarca las diferencias entre IaaS, PaaS y SaaS, junto con los despliegues públicos, privados e híbridos. Fundamenta todas las decisiones posteriores sobre servicios de datos en la nube en un contexto arquitectónico.

  • Lección 2 • Componentes Fundamentales de Infraestructura en la Nube

    Presenta las primitivas de cómputo, almacenamiento, redes e identidad utilizadas en las principales plataformas de nube. Proporciona el vocabulario necesario para diseñar y discutir infraestructura de datos.

  • Lección 3 • Fundamentos de Seguridad y Cumplimiento en la Nube

    Abarca el cifrado en reposo y en tránsito, la gestión de claves y los marcos de cumplimiento normativo para datos. Establece hábitos de seguridad que se aplican a lo largo de todo el curso.

  • Lección 4 • Conceptos Básicos de Precios y Gestión de Costos en la Nube

    Explica los modelos de precios de pago por uso, capacidad reservada y precios spot relevantes para las cargas de trabajo de datos. Permite tomar decisiones de arquitectura conscientes de los costos desde el principio.

Capítulo 2Ver detalles

Sistemas de Almacenamiento de Datos en la Nube

  • Lección 1 • Cómo Elegir el Almacenamiento Adecuado para Cada Caso de Uso

    Aplica un marco de decisión para hacer coincidir los sistemas de almacenamiento con los requisitos de latencia, rendimiento y costo. Sintetiza todas las opciones de almacenamiento en una guía de selección práctica.

  • Lección 2 • Opciones de Almacenes NoSQL y Clave-Valor

    Abarca los modelos de bases de datos documentales, de columnas anchas, clave-valor y de grafos disponibles como servicios en la nube. Orienta la selección en función de los patrones de acceso y los requisitos de consistencia.

  • Lección 3 • Servicios de Bases de Datos Relacionales en la Nube

    Examina las ofertas de bases de datos relacionales gestionadas, las configuraciones de alta disponibilidad y las réplicas de lectura. Conecta los fundamentos de SQL con los patrones de despliegue gestionados en la nube.

  • Lección 4 • Data Warehousing como Servicio en la Nube

    Presenta el almacenamiento columnar, la arquitectura MPP y el aprovisionamiento y escalado de almacenes de datos en la nube. Prepara a los estudiantes para las cargas de trabajo de consultas analíticas que se abordan en capítulos posteriores.

  • Lección 5 • Almacenamiento de Objetos y Data Lakes

    Explica la arquitectura de almacenamiento de objetos, las políticas de buckets, las reglas de ciclo de vida y los patrones de organización de data lakes. Constituye la base para todo el trabajo de ingesta y almacenamiento de datos a gran escala.

Capítulo 3Ver detalles

Fundamentos de Ingesta de Datos y Pipelines

  • Lección 1 • Patrones y Herramientas de Ingesta por Lotes

    Abarca las transferencias programadas de archivos, la ingesta masiva mediante API y las estrategias de carga incremental para pipelines por lotes. Establece el patrón de ingesta más común antes de introducir el streaming.

  • Lección 2 • Técnicas de Captura de Datos Modificados (CDC)

    Explica los métodos de CDC basados en logs, triggers y marcas de tiempo para capturar cambios en la base de datos. Permite la replicación casi en tiempo real sin escaneos completos de tablas.

  • Lección 3 • Fundamentos de Ingesta por Streaming

    Presenta los conceptos de streaming de eventos, productores, consumidores, tópicos y particiones para el flujo de datos en tiempo real. Conecta los conocimientos de ingesta por lotes con el procesamiento continuo de datos.

  • Lección 4 • Conceptos Básicos de Orquestación de Pipelines

    Abarca la orquestación basada en DAG, las dependencias de tareas, los reintentos y las alertas para la gestión de pipelines de datos. Proporciona la columna vertebral operativa para todos los tipos de pipelines construidos en este curso.

Capítulo 4Ver detalles

Transformación y Procesamiento de Datos a Escala

  • Lección 1 • Orquestación de Flujos de Trabajo de Transformación

    Aplica herramientas de orquestación para programar, monitorear y versionar trabajos de transformación a escala. Extiende los fundamentos de orquestación de pipelines a flujos de trabajo de transformación complejos de varios pasos.

  • Lección 2 • Modelado de Datos para Analítica

    Presenta el esquema en estrella, el esquema copo de nieve y el modelado Data Vault para cargas de trabajo analíticas. Asegura que los resultados de la transformación estén estructurados para consultas eficientes posteriores.

  • Lección 3 • Patrones de Transformación Basados en SQL

    Abarca funciones de ventana, CTEs, modelos incrementales y optimización de consultas para transformaciones SQL a gran escala. Conecta las habilidades de SQL con los motores de consulta de almacenes de datos y data lakes en la nube.

  • Lección 4 • Procesamiento Distribuido por Lotes con Spark

    Enseña las APIs de RDD y DataFrame, el particionamiento, la redistribución y la optimización de trabajos en Apache Spark. Establece el motor de procesamiento distribuido principal utilizado a lo largo del curso.

  • Lección 5 • Optimización del Rendimiento para Trabajos a Gran Escala

    Aborda el almacenamiento en caché, las uniones broadcast, la selección de formatos de archivo y el dimensionamiento de clústeres para el rendimiento de la transformación. Prepara a los estudiantes para diagnosticar y resolver cuellos de botella en pipelines de producción.

Capítulo 5Ver detalles

Procesamiento de Datos en Streaming y Pipelines en Tiempo Real

  • Lección 1 • Ventanas y Semántica Temporal

    Abarca ventanas de tiempo fijo, deslizantes y de sesión, junto con el tiempo del evento, el tiempo de procesamiento y los watermarks. Permite agregaciones precisas sobre flujos de eventos desordenados y con llegada tardía.

  • Lección 2 • Patrones de Diseño de Pipelines de Streaming

    Aplica las arquitecturas lambda, kappa y streaming-first a escenarios reales de ingeniería de datos. Conecta el conocimiento de los frameworks con las decisiones de diseño de pipelines de extremo a extremo.

  • Lección 3 • Procesamiento de Streams con Estado

    Explica el estado por clave, el estado del operador, los puntos de control y los backends de estado para trabajos de streaming tolerantes a fallos. Permite la detección de eventos complejos y agregaciones continuas en flujos ilimitados.

  • Lección 4 • Panorama General de Frameworks de Procesamiento de Streaming

    Compara Apache Flink, Spark Structured Streaming y los servicios de streaming gestionados en la nube por capacidad. Orienta la selección del framework en función de los requisitos de latencia, estado y operaciones.

Capítulo 6Ver detalles

Calidad de Datos, Gobernanza y Observabilidad

  • Lección 1 • Contratos de Datos y Gestión de Esquemas

    Define los contratos de datos entre productores y consumidores y cubre el uso y la evolución del registro de esquemas. Evita que los cambios incompatibles se propaguen a través de los sistemas de datos dependientes.

  • Lección 2 • Marcos de Validación de Calidad de Datos

    Abarca la validación de esquemas, las comprobaciones de nulos, la integridad referencial y la elaboración de perfiles estadísticos para la calidad de los datos. Integra compuertas de calidad directamente en los pipelines de ingesta y transformación.

  • Lección 3 • Linaje y Catalogación de Datos

    Explica el linaje a nivel de columna, la catalogación de metadatos y las herramientas de descubrimiento de datos para el cumplimiento de la gobernanza. Permite a los equipos rastrear los orígenes de los datos y comprender el impacto posterior de los cambios.

  • Lección 4 • Observabilidad y Monitoreo de Pipelines

    Presenta métricas, logs, trazas y seguimiento de SLAs para el monitoreo de la salud del pipeline de extremo a extremo. Proporciona la visibilidad operativa necesaria para mantener los sistemas de datos en producción de manera confiable.

  • Lección 5 • Control de Acceso y Privacidad de Datos

    Abarca el acceso basado en roles, la seguridad a nivel de fila, el enmascaramiento de datos y las técnicas de preservación de la privacidad para datos sensibles. Alinea los patrones de acceso a datos con los requisitos normativos y organizacionales.

Capítulo 7Ver detalles

Arquitectura y Diseño de Plataformas de Datos en la Nube

  • Lección 1 • Diseño para Entornos Multi-Cloud e Híbridos

    Abarca la portabilidad de datos, las redes entre nubes y las herramientas neutrales respecto al proveedor para plataformas de datos multi-cloud. Prepara a los estudiantes para diseñar plataformas que eviten la dependencia de un único proveedor.

  • Lección 2 • Patrones de Escalabilidad y Confiabilidad

    Aborda el escalado horizontal, la tolerancia a fallos, la idempotencia y la recuperación ante desastres para los componentes de la plataforma de datos. Asegura que los diseños de la plataforma cumplan con los requisitos de confiabilidad y disponibilidad de producción.

  • Lección 3 • Estrategias de Optimización de Costos de la Plataforma

    Aplica el dimensionamiento correcto, el uso de spot, la organización por niveles de almacenamiento y los controles de costos de consultas para reducir el gasto de la plataforma. Conecta las decisiones arquitectónicas directamente con resultados de costos medibles.

  • Lección 4 • Arquitecturas de Referencia de Plataformas de Datos Modernas

    Examina las arquitecturas medallón, data mesh y lakehouse como modelos para plataformas de datos en la nube. Proporciona el vocabulario y los patrones arquitectónicos para los ejercicios de diseño que se presentan a continuación.

  • Lección 5 • Infraestructura como Código para Plataformas de Datos

    Abarca el aprovisionamiento declarativo de infraestructura, los módulos, la gestión del estado y CI/CD para recursos de datos en la nube. Permite el despliegue repetible y con control de versiones de todos los componentes de la infraestructura de datos.

Capítulo 8Ver detalles

DataOps, Despliegue y Operaciones de Producción

  • Lección 1 • Planificación de Capacidad y Gestión del Rendimiento

    Aplica pruebas de carga, previsión de recursos y evaluación comparativa del rendimiento a las decisiones de capacidad de la plataforma de datos. Asegura que las plataformas escalen de manera proactiva en lugar de reactiva frente a volúmenes de datos crecientes.

  • Lección 2 • Cultura DataOps y Mejora Continua

    Presenta los principios de DataOps, los ciclos de retroalimentación, el versionado de pipelines y las prácticas de colaboración en equipo. Incorpora una mentalidad de mejora continua en las operaciones diarias de ingeniería de datos.

  • Lección 3 • Gestión de Entornos y Configuración

    Abarca la paridad entre los entornos de desarrollo, staging y producción, la gestión de secretos y las configuraciones específicas del entorno. Previene la deriva en la configuración y la exposición de credenciales en los entornos de despliegue.

  • Lección 4 • Pipelines de CI/CD para Ingeniería de Datos

    Construye flujos de trabajo automatizados de pruebas, linting, despliegue y rollback para código de pipelines de datos. Aplica las prácticas de entrega de la ingeniería de software al ciclo de vida de la ingeniería de datos.

  • Lección 5 • Respuesta a Incidentes para Sistemas de Datos

    Define los niveles de severidad de incidentes, runbooks, análisis de causa raíz y procesos de post mortem para interrupciones de datos. Construye la disciplina operativa necesaria para mantener los SLAs de datos bajo condiciones de falla.

Certificación

Tu certificado válido de finalización

Este curso es para vos:

  • Analista de datos: listo para moverse aguas arriba y ser dueño de los pipelines que alimentan sus reportes.

  • Ingeniero de software: quiere especializarse en infraestructura de datos y trabajo con sistemas distribuidos.

  • Desarrollador de BI: busca expandirse más allá de los dashboards hacia la ingeniería de plataformas de datos escalables.

  • Ingeniero de datos junior: busca un plan de estudios estructurado para cerrar brechas de conocimiento críticas rápidamente.

  • Desarrollador backend: en transición hacia roles de datos nativos de la nube en empresas impulsadas por datos.

  • Ingeniero de analytics: apunta a profundizar su expertise en ingesta, streaming y operaciones de producción.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los recomendé a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltear contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompts

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en Argentina?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF