Elige tu idioma
Curso de Python para ingeniería de datos
Más de 2 millones de estudiantes en todo el mundo

Curso de Python para ingeniería de datos

Domina las habilidades de Python que los ingenieros de datos usan a diario: desde la construcción de pipelines ETL y la conexión a bases de datos hasta la orquestación de flujos de trabajo y el despliegue de código listo para producción. Este curso te lleva desde los fundamentos de Python hasta patrones avanzados de ingeniería de datos utilizados a gran escala.

Dedika para empresas

Lo que vas a aprender:

Aprenderás a escribir scripts de Python que extraen datos de APIs, archivos y bases de datos, para luego transformarlos y cargarlos en bases de datos relacionales, almacenes de datos y almacenamiento en la nube. Trabajarás con Pandas para la manipulación de datos, SQLAlchemy para la conectividad con bases de datos y Apache Airflow para la orquestación de pipelines. El curso cubre la validación de calidad de datos, la optimización de rendimiento, el procesamiento en paralelo y las prácticas de CI/CD para el despliegue de pipelines. También explorarás PySpark para el procesamiento distribuido, Kafka para pipelines de streaming y las mejores prácticas de seguridad para proteger datos sensibles en entornos de producción.

Cómo estudias de forma práctica Curso de Python para ingeniería de datos

Cómo practicas Curso de Python para ingeniería de datos

Para ti que tienes una empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de Python para Ingenieros de Datos

  • Lección 1 • Flujo de Control e Iteración

    Aplica condicionales, bucles y comprensiones para procesar secuencias de registros de datos. Se relaciona directamente con la lógica de transformación a nivel de fila utilizada en pipelines de ETL.

  • Lección 2 • Funciones y Manejo de Errores

    Define funciones reutilizables con argumentos, valores predeterminados y valores de retorno; luego maneja excepciones de forma controlada. Permite un código de pipeline modular y tolerante a fallos.

  • Lección 3 • Sintaxis Básica de Python y Tipos de Datos

    Cubre variables, operadores y tipos integrados como cadenas, enteros, flotantes y booleanos. Proporciona la base sintáctica para escribir cualquier lógica de pipeline de datos.

  • Lección 4 • Colecciones: Listas, Tuplas, Diccionarios, Conjuntos

    Explora tipos de colección mutables e inmutables y sus ventajas y desventajas de desempeño. Estas estructuras sustentan la manipulación de datos en memoria a lo largo del curso.

  • Lección 5 • Configuración del Entorno de Python

    Instala Python, configura entornos virtuales y selecciona un IDE adecuado para el trabajo con datos. Establece el espacio de trabajo reproducible del que dependen todos los capítulos posteriores.

Capítulo 2Ver detalles

E/S de Archivos y Serialización de Datos

  • Lección 1 • Formatos Binarios: Parquet y Avro

    Lee y escribe archivos columnares Parquet y archivos basados en filas Avro usando bibliotecas de Python. Estos formatos son estándar en las arquitecturas modernas de lago de datos.

  • Lección 2 • Trabajo con Archivos de Texto y CSV

    Abre, lee y escribe archivos de texto usando administradores de contexto; luego analiza CSV con la biblioteca estándar. Cubre el formato de datos sin procesar más común en pipelines por lotes.

  • Lección 3 • Operaciones de Sistema de Archivos y Rutas

    Navega por directorios, busca archivos con glob y gestiona rutas usando los módulos pathlib y os. Automatiza los pasos de descubrimiento de archivos comunes en flujos de trabajo de ingesta por lotes.

  • Lección 4 • Formatos de Datos JSON y XML

    Analiza y serializa cargas útiles JSON y navega por árboles XML para procesar respuestas de API y archivos de configuración. Se conecta con la ingesta real de respuestas de API REST.

Capítulo 3Ver detalles

Manipulación de Datos con Pandas

  • Lección 1 • Fundamentos de DataFrames y Series

    Crea DataFrames desde diccionarios, CSV y JSON; luego inspecciona la estructura y los tipos de datos. Forma la base para todo el trabajo de transformación basado en Pandas.

  • Lección 2 • Filtrado, Ordenamiento y Selección

    Aplica máscaras booleanas, selectores loc/iloc y operaciones de ordenamiento para aislar subconjuntos de datos relevantes. Apoya directamente el filtrado de calidad de datos en las etapas del pipeline.

  • Lección 3 • Agregación, Agrupación y Pivotaje

    Resume datos con operaciones groupby, agg y pivot para producir resultados analíticos. Permite el cálculo de métricas y la generación de reportes dentro de los flujos de trabajo del pipeline.

  • Lección 4 • Limpieza de Datos y Coerción de Tipos

    Maneja valores faltantes, duplicados y tipos incorrectos para producir conjuntos de datos limpios y consistentes. La limpieza es el paso que más tiempo consume en los pipelines de datos del mundo real.

  • Lección 5 • Unión (Merge) y Combinación (Join) de DataFrames

    Combina conjuntos de datos usando merge, join y concat para replicar la lógica relacional estilo SQL. Esencial para desnormalizar datos antes de cargarlos en almacenes analíticos.

Capítulo 4Ver detalles

Conectividad a Bases de Datos e Integración SQL

  • Lección 1 • Trabajo con Bases de Datos NoSQL

    Conéctate a almacenes de documentos y clave-valor, realiza operaciones CRUD y asigna resultados a objetos de Python. Amplía la conectividad del pipeline más allá de los sistemas relacionales.

  • Lección 2 • Bases de Datos Relacionales con SQLAlchemy

    Establece conexiones, refleja esquemas y ejecuta SQL sin procesar usando la API central de SQLAlchemy. Proporciona una capa de acceso independiente de la base de datos para el código del pipeline.

  • Lección 3 • Agrupación de Conexiones (Pooling) y Mejores Prácticas

    Configura grupos de conexiones, gestiona credenciales de forma segura y evita anti-patrones comunes. Asegura la fiabilidad y seguridad de nivel producción en el código de acceso a bases de datos.

  • Lección 4 • Escritura y Upsert de Datos

    Inserta, actualiza y realiza upsert de registros mediante programación usando SQLAlchemy y to_sql de Pandas. Cubre la ruta de escritura necesaria para cargar las salidas del pipeline en bases de datos.

Capítulo 5Ver detalles

Construcción de Pipelines ETL en Python

  • Lección 1 • Registro (Logging) y Observabilidad del Pipeline

    Instrumenta pipelines con registro estructurado, métricas y alertas para permitir el monitoreo operativo. Transforma scripts en procesos observables y listos para producción.

  • Lección 2 • Lógica de Transformación y Reglas de Negocio

    Implementa mapeos de campos, columnas derivadas y reglas de validación como funciones puras de Python. Encapsula la lógica de negocio en unidades de transformación comprobables y reutilizables.

  • Lección 3 • Carga de Datos en Sistemas de Destino

    Escribe datos transformados en bases de datos, almacenes de datos y almacenamiento de objetos usando conectores de Python. Completa el pipeline entregando datos limpios a su destino.

  • Lección 4 • Arquitectura ETL y Patrones de Diseño

    Comprende las etapas del pipeline, el flujo de datos y los patrones de diseño comunes como ELT y la arquitectura medallón. Establece el marco conceptual para todo el trabajo de implementación de pipelines.

  • Lección 5 • Extracción de Datos desde APIs

    Obtén datos de APIs REST usando la biblioteca requests, maneja la paginación y gestiona los límites de velocidad. Cubre la fuente de datos moderna más común para pipelines de ingesta.

Capítulo 6Ver detalles

Trabajo con Almacenamiento y Servicios en la Nube

  • Lección 1 • Infraestructura como Código para Pipelines de Datos

    Define recursos en la nube mediante programación usando herramientas de IaC basadas en Python para automatizar la configuración del entorno. Reduce el aprovisionamiento manual y asegura una infraestructura de pipeline reproducible.

  • Lección 2 • Ingesta Impulsada por Eventos con Colas de Mensajes

    Produce y consume mensajes de colas y tópicos de streaming para desencadenar la ejecución del pipeline. Conecta los pipelines de Python con arquitecturas de datos impulsadas por eventos y en tiempo real.

  • Lección 3 • Interacción con Almacenes de Datos Gestionados

    Conéctate a almacenes de datos en la nube mediante conectores de Python, ejecuta consultas y carga datos de manera eficiente. Permite que los pipelines de Python sirvan cargas de trabajo analíticas a escala.

  • Lección 4 • Almacenamiento de Objetos en la Nube con SDKs de Python

    Sube, descarga, lista y elimina objetos en buckets de almacenamiento en la nube usando los SDKs del proveedor. El almacenamiento de objetos es la zona de aterrizaje principal para datos sin procesar en pipelines en la nube.

Capítulo 7Ver detalles

Orquestación y Programación de Pipelines

  • Lección 1 • Estrategias de Manejo de Errores y Reintentos

    Configura reintentos, tiempos de espera y alertas de SLA para hacer que los pipelines orquestados sean resistentes a fallos transitorios. Reduce directamente la intervención manual en entornos de producción.

  • Lección 2 • DAGs Dinámicos y Parametrización

    Genera DAGs mediante programación y pasa parámetros de tiempo de ejecución a las tareas para una ejecución de pipeline flexible. Permite la orquestación escalable de muchas variantes de pipelines similares.

  • Lección 3 • Conceptos de Orquestación y Panorama de Herramientas

    Comprende los DAGs, las dependencias de tareas y el rol de los orquestadores en la ingeniería de datos. Proporciona la base conceptual antes de implementar código de orquestación.

  • Lección 4 • Construcción de DAGs con Apache Airflow

    Define DAGs, operadores y dependencias de tareas en Airflow usando Python para programar ejecuciones de pipelines. Airflow es el orquestador más ampliamente implementado en ingeniería de datos.

  • Lección 5 • Monitoreo y Alertas en Orquestación

    Usa las interfaces de usuario del orquestador, los registros y las integraciones de alertas externas para rastrear el estado del pipeline. Cierra el ciclo de observabilidad para las operaciones del pipeline de extremo a extremo.

Capítulo 8Ver detalles

Desempeño, Pruebas y Preparación para Producción

  • Lección 1 • Calidad del Código y Empaquetado

    Refuerza el estilo con linters, verifica tipos con mypy y empaqueta el código del pipeline como módulos de Python instalables. Eleva la mantenibilidad del código a los estándares profesionales de la ingeniería de software.

  • Lección 2 • Pruebas Unitarias y de Integración para Pipelines

    Escribe pruebas unitarias basadas en pytest para funciones de transformación y pruebas de integración para interacciones con bases de datos. Las pruebas previenen regresiones y validan la corrección del pipeline.

  • Lección 3 • Procesamiento Paralelo y Concurrente

    Aplica patrones de multiprocesamiento, hilos y asincronía para paralelizar tareas de pipeline limitadas por E/S y CPU. Reduce significativamente el tiempo de ejecución del pipeline de extremo a extremo.

  • Lección 4 • Perfilado y Optimización de Código Python

    Identifica cuellos de botella usando herramientas de perfilado y aplica vectorización, procesamiento por fragmentos y almacenamiento en caché para mejorar el rendimiento. La optimización del desempeño es crítica para pipelines de datos a gran escala.

  • Lección 5 • CI/CD para Despliegue de Pipelines de Datos

    Automatiza las pruebas, el linting y el despliegue del código del pipeline utilizando pipelines de CI/CD activados por eventos de control de versiones. Permite lanzamientos a producción seguros y repetibles.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Analista de datos junior: listo para automatizar flujos de trabajo / workflows de datos repetitivos con Python.

  • Desarrollador SQL: que quiere ampliar sus habilidades en la construcción programática de pipelines.

  • Desarrollador de software: transición a ingeniería de datos desde una formación general en programación.

  • Ingeniero de inteligencia de negocios: busca tener el control total del pipeline de datos de principio a fin.

  • Recién egresado/a de ciencias de la computación: en busca de experiencia práctica en ingeniería de datos, listo para el mundo laboral.

  • Programador autodidacta: apasionado por los datos y con la meta de un puesto de ingeniería.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en México?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF