
Curso de Python para Data Engineers
Domine las habilidades en Python que los ingenieros de datos usan a diario: desde construir pipelines de ETL y conectarse a bases de datos hasta orquestar flujos de trabajo y desplegar código listo para producción. Este curso lo lleva desde los fundamentos de Python hasta los patrones avanzados de ingeniería de datos que se utilizan a escala.
Qué vas a aprender:
Usted aprenderá a escribir scripts en Python que extraen datos de APIs, archivos y bases de datos, para luego transformarlos y cargarlos en bases de datos relacionales, bodegas de datos y almacenamiento en la nube. Trabajará con Pandas para la manipulación de datos, SQLAlchemy para la conectividad con bases de datos y Apache Airflow para la orquestación de pipelines. El curso cubre la validación de la calidad de los datos, la optimización del rendimiento, el procesamiento en paralelo y las prácticas de CI/CD para el despliegue de pipelines. También explorará PySpark para el procesamiento distribuido, Kafka para pipelines de streaming y las mejores prácticas de seguridad para proteger datos sensibles en entornos de producción.
Cómo estudias de forma práctica Curso de Python para Data Engineers
Cómo practicas Curso de Python para Data Engineers
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de Python para Ingenieros de Datos
Fundamentos de Python para Ingenieros de Datos
Lección 1 • Flujo de Control e Iteración
Aplique condicionales, bucles y comprensiones para procesar secuencias de registros de datos. Se relaciona directamente con la lógica de transformación a nivel de fila usada en pipelines de ETL.
Lección 2 • Funciones y Manejo de Errores
Defina funciones reutilizables con argumentos, valores predeterminados y valores de retorno, luego maneje excepciones con elegancia. Habilita código de pipeline modular y tolerante a fallos.
Lección 3 • Sintaxis Básica de Python y Tipos de Datos
Cubra variables, operadores y tipos integrados incluyendo cadenas, enteros, flotantes y booleanos. Proporciona la base sintáctica para escribir cualquier lógica de pipeline de datos.
Lección 4 • Colecciones: Listas, Tuplas, Diccionarios, Conjuntos
Explore tipos de colección mutables e inmutables y sus ventajas y desventajas de rendimiento. Estas estructuras sustentan la manipulación de datos en memoria a lo largo del curso.
Lección 5 • Configuración del Entorno de Python
Instale Python, configure entornos virtuales y seleccione un IDE adecuado para el trabajo con datos. Establece el espacio de trabajo reproducible del que dependen todos los capítulos posteriores.
Capítulo 2OcultarOcultar detallesVer detallesE/S de Archivos y Serialización de Datos
E/S de Archivos y Serialización de Datos
Lección 1 • Formatos Binarios: Parquet y Avro
Lea y escriba archivos Parquet columnares y Avro basados en filas usando librerías de Python. Estos formatos son estándar en arquitecturas modernas de lago de datos.
Lección 2 • Trabajo con Archivos de Texto y CSV
Abra, lea y escriba archivos de texto usando context managers, luego analice CSV con la librería estándar. Cubre el formato de datos crudos más común en pipelines por lotes.
Lección 3 • Sistema de Archivos y Operaciones de Ruta
Navegue directorios, busque archivos con glob y gestione rutas usando los módulos pathlib y os. Automatiza los pasos de descubrimiento de archivos comunes en flujos de trabajo de ingesta por lotes.
Lección 4 • Formatos de Datos JSON y XML
Analice y serialice payloads JSON y navegue árboles XML para procesamiento de API y archivos de configuración. Se conecta con la ingesta real de respuestas de API REST.
Capítulo 3OcultarOcultar detallesVer detallesManipulación de Datos con Pandas
Manipulación de Datos con Pandas
Lección 1 • Fundamentos de DataFrames y Series
Cree DataFrames desde diccionarios, CSV y JSON, luego inspeccione la estructura y los tipos de datos. Forma la base para todo el trabajo de transformación basado en Pandas.
Lección 2 • Filtrado, Ordenamiento y Selección
Aplique máscaras booleanas, selectores loc/iloc y operaciones de ordenamiento para aislar subconjuntos de datos relevantes. Apoya directamente el filtrado de calidad de datos en etapas del pipeline.
Lección 3 • Agregación, Agrupación y Pivotaje
Resuma datos con operaciones groupby, agg y pivot para producir salidas analíticas. Habilita el cálculo de métricas y la generación de informes dentro de los flujos de trabajo del pipeline.
Lección 4 • Limpieza de Datos y Coerción de Tipos
Maneje valores faltantes, duplicados y tipos incorrectos para producir conjuntos de datos limpios y consistentes. La limpieza es el paso que más tiempo consume en los pipelines de datos del mundo real.
Lección 5 • Unión y Combinación de DataFrames
Combine conjuntos de datos usando merge, join y concat para replicar la lógica relacional al estilo SQL. Esencial para desnormalizar datos antes de cargarlos en almacenes analíticos.
Capítulo 4OcultarOcultar detallesVer detallesConectividad a Bases de Datos e Integración SQL
Conectividad a Bases de Datos e Integración SQL
Lección 1 • Trabajo con Bases de Datos NoSQL
Conéctese a almacenes de documentos y clave-valor, realice operaciones CRUD y asigne resultados a objetos de Python. Amplía la conectividad del pipeline más allá de los sistemas relacionales.
Lección 2 • Bases de Datos Relacionales con SQLAlchemy
Establezca conexiones, refleje esquemas y ejecute SQL crudo usando la API central de SQLAlchemy. Proporciona una capa de acceso independiente de la base de datos para el código del pipeline.
Lección 3 • Agrupación de Conexiones y Mejores Prácticas
Configure agrupaciones de conexiones, gestione credenciales de forma segura y evite antipatrones comunes. Garantiza confiabilidad y seguridad de grado de producción en el código de acceso a bases de datos.
Lección 4 • Escritura y Upsert de Datos
Inserte, actualice y haga upsert de registros programáticamente usando SQLAlchemy y Pandas to_sql. Cubre la ruta de escritura requerida para cargar las salidas del pipeline en bases de datos.
Capítulo 5OcultarOcultar detallesVer detallesConstrucción de Pipelines ETL en Python
Construcción de Pipelines ETL en Python
Lección 1 • Registro y Observabilidad del Pipeline
Instrumente pipelines con registro estructurado, métricas y alertas para permitir el monitoreo operacional. Transforme scripts en procesos observables y listos para producción.
Lección 2 • Lógica de Transformación y Reglas de Negocio
Implemente mapeos de campos, columnas derivadas y reglas de validación como funciones puras de Python. Encapsule la lógica de negocio en unidades de transformación comprobables y reutilizables.
Lección 3 • Carga de Datos a Sistemas de Destino
Escriba datos transformados en bases de datos, bodegas de datos y almacenamiento de objetos usando conectores de Python. Completa el pipeline entregando datos limpios a su destino.
Lección 4 • Arquitectura ETL y Patrones de Diseño
Comprenda las etapas del pipeline, el flujo de datos y patrones de diseño comunes como ELT y la arquitectura medallón. Establece el marco conceptual para todo el trabajo de implementación de pipelines.
Lección 5 • Extracción de Datos desde APIs
Obtenga datos de API REST usando la librería requests, maneje la paginación y gestione los límites de tasa. Cubre la fuente de datos moderna más común para pipelines de ingesta.
Capítulo 6OcultarOcultar detallesVer detallesTrabajo con Almacenamiento y Servicios en la Nube
Trabajo con Almacenamiento y Servicios en la Nube
Lección 1 • Infraestructura como Código para Pipelines de Datos
Defina recursos en la nube programáticamente usando herramientas de IaC basadas en Python para automatizar la configuración del entorno. Reduce el aprovisionamiento manual y garantiza una infraestructura de pipeline reproducible.
Lección 2 • Ingesta Impulsada por Eventos con Colas de Mensajes
Produzca y consuma mensajes de colas y temas de streaming para activar la ejecución del pipeline. Conecta los pipelines de Python con arquitecturas de datos impulsadas por eventos y en tiempo real.
Lección 3 • Interacción con Bodegas de Datos Gestionadas
Conéctese a bodegas de datos en la nube mediante conectores Python, ejecute consultas y cargue datos de manera eficiente. Permite que los pipelines de Python sirvan cargas de trabajo analíticas a escala.
Lección 4 • Almacenamiento de Objetos en la Nube con SDKs de Python
Suba, descargue, liste y elimine objetos en buckets de almacenamiento en la nube usando los SDKs del proveedor. El almacenamiento de objetos es la zona de aterrizaje principal para datos crudos en pipelines en la nube.
Capítulo 7OcultarOcultar detallesVer detallesOrquestación y Programación de Pipelines
Orquestación y Programación de Pipelines
Lección 1 • Manejo de Errores y Estrategias de Reintento
Configure reintentos, tiempos de espera y alertas de SLA para hacer que los pipelines orquestados sean resistentes a fallos transitorios. Reduce directamente la intervención manual en entornos de producción.
Lección 2 • DAGs Dinámicos y Parametrización
Genere DAGs programáticamente y pase parámetros de tiempo de ejecución a las tareas para una ejecución flexible del pipeline. Permite la orquestación escalable de muchas variantes de pipeline similares.
Lección 3 • Conceptos de Orquestación y Panorama de Herramientas
Comprenda los DAGs, las dependencias de tareas y el rol de los orquestadores en la ingeniería de datos. Proporciona la base conceptual antes de implementar el código de orquestación.
Lección 4 • Construcción de DAGs con Apache Airflow
Defina DAGs, operadores y dependencias de tareas en Airflow usando Python para programar ejecuciones de pipeline. Airflow es el orquestador más ampliamente desplegado en ingeniería de datos.
Lección 5 • Monitoreo y Alertas en Orquestación
Use las interfaces de usuario del orquestador, los registros y las integraciones de alertas externas para rastrear el estado del pipeline. Cierra el ciclo de observabilidad para las operaciones de pipeline de extremo a extremo.
Capítulo 8OcultarOcultar detallesVer detallesRendimiento, Pruebas y Preparación para Producción
Rendimiento, Pruebas y Preparación para Producción
Lección 1 • Calidad de Código y Empaquetado
Haga cumplir el estilo con linters, verifique tipos con mypy y empaquete el código del pipeline como módulos Python instalables. Eleva la mantenibilidad del código a los estándares profesionales de ingeniería de software.
Lección 2 • Pruebas Unitarias y de Integración para Pipelines
Escriba pruebas unitarias basadas en pytest para funciones de transformación y pruebas de integración para interacciones con bases de datos. Las pruebas previenen regresiones y validan la corrección del pipeline.
Lección 3 • Procesamiento Paralelo y Concurrente
Aplique patrones de multiprocessing, threading y async para paralelizar tareas de pipeline limitadas por E/S y por CPU. Reduce significativamente el tiempo de ejecución del pipeline de extremo a extremo.
Lección 4 • Perfilamiento y Optimización de Código Python
Identifique cuellos de botella usando herramientas de perfilamiento y aplique vectorización, procesamiento por fragmentos y almacenamiento en caché para mejorar el rendimiento. La optimización del rendimiento es crítica para pipelines de datos a gran escala.
Lección 5 • CI/CD para Despliegue de Pipelines de Datos
Automatice las pruebas, el linting y el despliegue del código del pipeline usando pipelines de CI/CD activados por eventos de control de versiones. Permite lanzamientos a producción seguros y repetibles.
Tu certificado válido de finalización
Este curso es para ti:
Analista de datos junior: listo para automatizar flujos de trabajo repetitivos con Python.
Desarrollador SQL que desea ampliar sus habilidades hacia la construcción programática de pipelines.
Desarrollador de software: haciendo la transición a la ingeniería de datos desde una formación en programación general.
Ingeniero de inteligencia de negocios: con interés en ser dueño de todo el pipeline de datos de extremo a extremo.
Recién graduado en ciencias de la computación: busca experiencia práctica en ingeniería de datos, lista para el ámbito laboral.
Programador autodidacta: apasionado por los datos y con la meta de conseguir un puesto en ingeniería.
Lo que dicen nuestros estudiantes
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Ecuador?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















