Elige tu idioma
Curso de Python para Data Engineers
Más de 2 millones de estudiantes en todo el mundo

Curso de Python para Data Engineers

Dominá las habilidades de Python que los ingenieros de datos usan todos los días: desde construir pipelines de ETL y conectarse a bases de datos hasta orquestar flujos de trabajo y desplegar código listo para producción. Este curso te lleva desde los fundamentos de Python hasta los patrones avanzados de ingeniería de datos que se usan a escala.

Dedika para empresas

Lo que vas a aprender:

Vas a aprender a escribir scripts en Python que extraen datos de APIs, archivos y bases de datos, y luego los transforman y cargan en bases de datos relacionales, almacenes de datos y almacenamiento en la nube. Vas a trabajar con Pandas para la manipulación de datos, SQLAlchemy para la conectividad con bases de datos y Apache Airflow para la orquestación de pipelines. El curso cubre la validación de calidad de datos, la optimización del rendimiento, el procesamiento paralelo y las prácticas de CI/CD para el despliegue de pipelines. También vas a explorar PySpark para el procesamiento distribuido, Kafka para pipelines de streaming y las mejores prácticas de seguridad para proteger datos sensibles en entornos de producción.

Cómo estudias de forma práctica Curso de Python para Data Engineers

Cómo practicas Curso de Python para Data Engineers

Para ti que eres empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 37 ClasesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de Python para Ingenieros de Datos

  • Clase 1 • Flujo de Control e Iteración

    Aplicá condicionales, bucles y comprensiones para procesar secuencias de registros de datos. Se vincula directamente con la lógica de transformación a nivel de fila usada en pipelines de ETL.

  • Clase 2 • Funciones y Manejo de Errores

    Definí funciones reutilizables con argumentos, valores por defecto y retorno, y luego manejá excepciones correctamente. Permite un código de pipeline modular y tolerante a fallos.

  • Clase 3 • Sintaxis Central de Python y Tipos de Datos

    Cubrí variables, operadores y tipos incorporados, incluyendo strings, enteros, floats y booleanos. Proporciona la base sintáctica para escribir cualquier lógica de pipeline de datos.

  • Clase 4 • Colecciones: Listas, Tuplas, Diccionarios, Conjuntos

    Explorá los tipos de colecciones mutables e inmutables y sus contrapartidas de rendimiento. Estas estructuras sustentan la manipulación de datos en memoria a lo largo del curso.

  • Clase 5 • Configuración del Entorno de Python

    Instalá Python, configurá entornos virtuales y seleccioná un IDE adecuado para el trabajo con datos. Establece el espacio de trabajo reproducible del que dependen todos los capítulos siguientes.

Capítulo 2Ver detalles

I/O de Archivos y Serialización de Datos

  • Clase 1 • Formatos Binarios: Parquet y Avro

    Leé y escribí archivos Parquet columnares y Avro basados en filas usando librerías de Python. Estos formatos son estándar en las arquitecturas modernas de lagos de datos.

  • Clase 2 • Trabajo con Archivos de Texto y CSV

    Abrí, leé y escribí archivos de texto usando context managers, y luego parseá CSV con la librería estándar. Cubre el formato de datos crudos más común en pipelines batch.

  • Clase 3 • Operaciones con el Sistema de Archivos y Rutas

    Navegá directorios, buscá archivos con glob y gestioná rutas usando los módulos pathlib y os. Automatiza los pasos de descubrimiento de archivos comunes en flujos de ingesta batch.

  • Clase 4 • Formatos de Datos JSON y XML

    Parseá y serializá cargas JSON y navegá árboles XML para el procesamiento de APIs y archivos de configuración. Se conecta con la ingesta real de respuestas de API REST.

Capítulo 3Ver detalles

Manipulación de Datos con Pandas

  • Clase 1 • Fundamentos de DataFrames y Series

    Creá DataFrames desde diccionarios, CSV y JSON, y luego inspeccioná su estructura y tipos de datos. Forma la base para todo el trabajo de transformación con Pandas.

  • Clase 2 • Filtrado, Ordenamiento y Selección

    Aplicá máscaras booleanas, selectores loc/iloc y operaciones de ordenamiento para aislar subconjuntos de datos relevantes. Soporta directamente el filtrado de calidad de datos en etapas del pipeline.

  • Clase 3 • Agregación, Agrupamiento y Pivotado

    Resumí datos con operaciones groupby, agg y pivot para producir salidas analíticas. Permite el cálculo de métricas y reportes dentro de los flujos de trabajo del pipeline.

  • Clase 4 • Limpieza de Datos y Coerción de Tipos

    Manejá valores faltantes, duplicados y tipos incorrectos para producir datasets limpios y coherentes. La limpieza es el paso que más tiempo consume en los pipelines de datos del mundo real.

  • Clase 5 • Unión y Combinación de DataFrames

    Combiná datasets usando merge, join y concat para replicar la lógica relacional al estilo SQL. Esencial para desnormalizar datos antes de cargarlos en almacenes analíticos.

Capítulo 4Ver detalles

Conectividad a Bases de Datos e Integración SQL

  • Clase 1 • Trabajo con Bases de Datos NoSQL

    Conectate a almacenes de documentos y clave-valor, realizá operaciones CRUD y mapeá resultados a objetos Python. Extiende la conectividad del pipeline más allá de los sistemas relacionales.

  • Clase 2 • Bases de Datos Relacionales con SQLAlchemy

    Establecé conexiones, reflejá esquemas y ejecutá SQL crudo usando la API central de SQLAlchemy. Proporciona una capa de acceso agnóstica a la base de datos para el código del pipeline.

  • Clase 3 • Agrupamiento de Conexiones y Buenas Prácticas

    Configurá pools de conexiones, gestioná credenciales de forma segura y evitá antipatrones comunes. Asegura confiabilidad y seguridad de nivel producción en el código de acceso a bases de datos.

  • Clase 4 • Escritura y Upsert de Datos

    Insertá, actualizá y hacé upsert de registros programáticamente usando SQLAlchemy y Pandas to_sql. Cubre la ruta de escritura necesaria para cargar las salidas del pipeline en bases de datos.

Capítulo 5Ver detalles

Construcción de Pipelines ETL en Python

  • Clase 1 • Logging y Observabilidad del Pipeline

    Instrumentá pipelines con logging estructurado, métricas y alertas para permitir el monitoreo operacional. Transformá scripts en procesos observables y listos para producción.

  • Clase 2 • Lógica de Transformación y Reglas de Negocio

    Implementá mapeos de campos, columnas derivadas y reglas de validación como funciones Python puras. Encapsulá la lógica de negocio en unidades de transformación testeables y reutilizables.

  • Clase 3 • Carga de Datos a Sistemas de Destino

    Escribí datos transformados en bases de datos, almacenes de datos y almacenamiento de objetos usando conectores Python. Completá el pipeline entregando datos limpios a su destino.

  • Clase 4 • Arquitectura ETL y Patrones de Diseño

    Comprendé las etapas del pipeline, el flujo de datos y patrones de diseño comunes como ELT y la arquitectura medallón. Establecé el marco conceptual para todo el trabajo de implementación de pipelines.

  • Clase 5 • Extracción de Datos desde APIs

    Obtené datos de APIs REST usando la librería requests, manejá la paginación y gestioná los límites de tasa. Cubrí la fuente de datos moderna más común para pipelines de ingesta.

Capítulo 6Ver detalles

Trabajo con Almacenamiento en la Nube y Servicios

  • Clase 1 • Infraestructura como Código para Pipelines de Datos

    Definí recursos en la nube programáticamente usando herramientas de IaC basadas en Python para automatizar la configuración del entorno. Reducí el aprovisionamiento manual y asegurá una infraestructura de pipeline reproducible.

  • Clase 2 • Ingesta Basada en Eventos con Colas de Mensajes

    Producí y consumí mensajes de colas y tópicos de streaming para disparar la ejecución de pipelines. Conectá los pipelines de Python con arquitecturas de datos basadas en eventos y en tiempo real.

  • Clase 3 • Interacción con Almacenes de Datos Gestionados

    Conectate a almacenes de datos en la nube mediante conectores Python, ejecutá consultas y cargá datos de manera eficiente. Permití que los pipelines de Python sirvan cargas de trabajo analíticas a escala.

  • Clase 4 • Almacenamiento de Objetos en la Nube con SDKs de Python

    Subí, descargá, listá y eliminá objetos en buckets de almacenamiento en la nube usando los SDKs del proveedor. El almacenamiento de objetos es la zona de aterrizaje principal para datos crudos en pipelines en la nube.

Capítulo 7Ver detalles

Orquestación y Programación de Pipelines

  • Clase 1 • Estrategias de Manejo de Errores y Reintentos

    Configurá reintentos, timeouts y alertas de SLA para hacer que los pipelines orquestados sean resilientes a fallos transitorios. Reducí directamente la intervención manual en entornos de producción.

  • Clase 2 • DAGs Dinámicos y Parametrización

    Generá DAGs programáticamente y pasá parámetros de ejecución a las tareas para una ejecución de pipeline flexible. Permití la orquestación escalable de muchas variantes de pipeline similares.

  • Clase 3 • Conceptos de Orquestación y Panorama de Herramientas

    Comprendé los DAGs, las dependencias de tareas y el rol de los orquestadores en la ingeniería de datos. Proporcioná la base conceptual antes de implementar código de orquestación.

  • Clase 4 • Construcción de DAGs con Apache Airflow

    Definí DAGs, operadores y dependencias de tareas en Airflow usando Python para programar ejecuciones de pipelines. Airflow es el orquestador más ampliamente implementado en ingeniería de datos.

  • Clase 5 • Monitoreo y Alertas en Orquestación

    Usá las interfaces de usuario del orquestador, logs e integraciones de alertas externas para seguir la salud del pipeline. Cerrá el ciclo de observabilidad para operaciones de pipeline de extremo a extremo.

Capítulo 8Ver detalles

Rendimiento, Pruebas y Preparación para Producción

  • Clase 1 • Calidad de Código y Empaquetado

    Aplicá estilo con linters, verificá tipos con mypy y empaquetá el código del pipeline como módulos Python instalables. Elevá la mantenibilidad del código a estándares profesionales de ingeniería de software.

  • Clase 2 • Pruebas Unitarias y de Integración para Pipelines

    Escribí pruebas unitarias basadas en pytest para funciones de transformación y pruebas de integración para interacciones con bases de datos. Las pruebas previenen regresiones y validan la corrección del pipeline.

  • Clase 3 • Procesamiento Paralelo y Concurrente

    Aplicá patrones de multiprocessing, threading y async para paralelizar tareas de pipeline limitadas por I/O y CPU. Reducí significativamente el tiempo de ejecución del pipeline de extremo a extremo.

  • Clase 4 • Perfilado y Optimización de Código Python

    Identificá cuellos de botella usando herramientas de perfilado y aplicá vectorización, procesamiento por fragmentos y caché para mejorar el rendimiento. La optimización del rendimiento es crítica para pipelines de datos a gran escala.

  • Clase 5 • CI/CD para Despliegue de Pipelines de Datos

    Automatizá las pruebas, el linting y el despliegue del código del pipeline usando pipelines de CI/CD disparados por eventos de control de versiones. Permite lanzamientos a producción seguros y repetibles.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Analista de datos junior: listo para automatizar flujos de trabajo repetitivos con Python.

  • Desarrollador SQL: con ganas de ampliar sus habilidades en la construcción programática de pipelines.

  • Desarrollador de software: pasaje a ingeniería de datos desde una base de programación general.

  • Ingeniero de inteligencia de negocios: con ganas de ser dueño de todo el pipeline de datos de punta a punta.

  • Recién egresado en ciencias de la computación: busca experiencia práctica en ingeniería de datos lista para el trabajo.

  • Programador autodidacta: apasionado por los datos y con la meta de conseguir un puesto en ingeniería.

Lo que dicen nuestros estudiantes

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco por todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas Frecuentes

¿Quién es Dedika?

¿El certificado es válido en Chile?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF