
Curso de Web Scraping con Scrapy y Python
Aprenda a recolectar datos de cualquier sitio web usando Python y Scrapy, uno de los frameworks de extracción de datos web más potentes disponibles. Este curso lo lleva desde la configuración del entorno hasta la construcción de arañas listas para producción que manejan paginación, medidas anti-bot y páginas renderizadas con JavaScript. Al finalizar, usted tendrá un proyecto de portafolio y las habilidades prácticas para automatizar la recolección de datos a escala.
Qué vas a aprender:
Configure un entorno de desarrollo profesional de Python y Scrapy desde cero.
Construya arañas que sigan enlaces de paginación y rastreen sitios web completos de varias páginas automáticamente.
Extraiga, limpie y almacene datos estructurados en CSV, JSON, SQLite y MongoDB.
Aplique rotación de proxy, suplantación de agente de usuario y AutoThrottle para eludir defensas comunes contra la extracción de datos.
Extraiga datos de páginas renderizadas con JavaScript y aplicaciones de una sola página usando integración con Playwright.
Diseñe proyectos de extracción de datos web de extremo a extremo con pipelines reutilizables, esquemas de ítems y programación automatizada.
Cómo estudias de forma práctica Curso de Web Scraping con Scrapy y Python
Cómo practicas Curso de Web Scraping con Scrapy y Python
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 37 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesConfiguración del entorno de Python y Scrapy
Configuración del entorno de Python y Scrapy
Lección 1 • Entornos virtuales para proyectos Python
Crear entornos virtuales aislados para gestionar las dependencias del proyecto de forma ordenada. El aislamiento previene conflictos de paquetes entre múltiples proyectos.
Lección 2 • Configuración del editor de código para proyectos Scrapy
Configurar un editor de código con soporte para Python, linting y resaltado de sintaxis. Las herramientas adecuadas aceleran el desarrollo y reducen los errores de sintaxis.
Lección 3 • Instalación de Scrapy y sus dependencias
Instalar Scrapy mediante pip y resolver problemas comunes de dependencias. Una instalación limpia confirma que el entorno está listo para el desarrollo de arañas.
Lección 4 • Instalación y configuración de Python
Instalar Python y configurar las variables PATH para el acceso desde la línea de comandos. Una configuración correcta aquí previene errores de entorno a lo largo del curso.
Capítulo 2OcultarOcultar detallesVer detallesFundamentos web para scrapers
Fundamentos web para scrapers
Lección 1 • DevTools del navegador para investigación de scraping
Usar las herramientas de desarrollador del navegador para inspeccionar elementos, monitorizar el tráfico de red y copiar selectores. Este flujo de trabajo de investigación informa directamente el diseño de la araña.
Lección 2 • Expresiones XPath para selección avanzada
Escribir expresiones XPath para navegar el DOM con mayor flexibilidad que solo con CSS. XPath maneja patrones de recorrido complejos que CSS no puede expresar.
Lección 3 • Cómo funcionan las peticiones y respuestas HTTP
Trazar el ciclo de vida de una petición HTTP desde el navegador al servidor y de vuelta. Este modelo explica lo que Scrapy replica al obtener páginas.
Lección 4 • Selectores CSS para focalización de datos
Usar la sintaxis de selectores CSS para localizar elementos específicos dentro de un documento HTML. Estos selectores son la herramienta principal de focalización en las arañas de Scrapy.
Lección 5 • Estructura HTML y el DOM
Leer e interpretar documentos HTML como estructuras de árbol anidadas. Comprender el DOM es esencial para escribir selectores CSS y XPath precisos.
Capítulo 3OcultarOcultar detallesVer detallesConstrucción de su primera araña Scrapy
Construcción de su primera araña Scrapy
Lección 1 • Ejecución y depuración de arañas
Ejecutar arañas con el comando scrapy crawl e interpretar la salida del registro. Las habilidades de depuración reducen el tiempo perdido en arañas rotas.
Lección 2 • Anatomía de una clase Spider de Scrapy
Examinar la clase base Spider y sus atributos y métodos requeridos. Cada araña hereda esta estructura, por lo que dominarla es fundamental.
Lección 3 • Extracción de datos con selectores
Aplicar selectores CSS y XPath dentro del método parse para extraer texto y atributos. La extracción precisa es la habilidad central de cualquier araña.
Lección 4 • Estructura del proyecto Scrapy explicada
Generar un proyecto Scrapy y comprender el rol de cada archivo generado. Conocer la estructura previene ubicaciones incorrectas de código y errores de configuración.
Capítulo 4OcultarOcultar detallesVer detallesItems de Scrapy y modelado de datos
Items de Scrapy y modelado de datos
Lección 1 • Limpieza de datos con procesadores
Escribir funciones de procesador personalizadas para eliminar espacios, convertir tipos y normalizar valores de campo. La limpieza de datos a nivel del loader reduce la complejidad de los pipelines posteriores.
Lección 2 • Definición de Items de Scrapy
Declarar clases Item con campos tipados para representar registros extraídos. Los Items imponen un esquema consistente en todas las arañas de un proyecto.
Lección 3 • Uso de ItemLoaders para datos limpios
Aplicar ItemLoaders para automatizar el procesamiento de entrada y salida en los valores de campo. Los loaders separan la lógica de extracción de la lógica de limpieza para facilitar el mantenimiento.
Lección 4 • Validación de datos extraídos
Añadir validación a nivel de campo para detectar registros mal formados antes de que lleguen al almacenamiento. La validación temprana previene que datos corruptos entren en los pipelines.
Capítulo 5OcultarOcultar detallesVer detallesRastreo de múltiples páginas y sitios
Rastreo de múltiples páginas y sitios
Lección 1 • Seguimiento de enlaces con peticiones de Scrapy
Generar objetos scrapy.Request desde los métodos parse para instruir al rastreador a obtener URLs adicionales. El seguimiento de enlaces es el mecanismo detrás de los rastreos completos del sitio.
Lección 2 • Uso de CrawlSpider para rastreo basado en reglas
Aprovechar la subclase CrawlSpider y los objetos Rule para definir patrones de seguimiento de enlaces de forma declarativa. Las reglas reducen el código repetitivo para sitios grandes y estructurados.
Lección 3 • Gestión de la profundidad y el alcance del rastreo
Configurar límites de profundidad y filtros de URL para mantener los rastreos enfocados y eficientes. El control del alcance previene rastreos descontrolados que desperdician recursos.
Lección 4 • Estrategias de paginación
Detectar y seguir enlaces a la siguiente página en esquemas de paginación numerada y basada en cursor. El manejo de la paginación desbloquea la extracción completa del conjunto de datos.
Lección 5 • Paso de datos entre peticiones
Usar los diccionarios cb_kwargs y meta para transportar contexto de una petición a la siguiente. El contexto compartido permite el ensamblaje de registros entre múltiples páginas.
Capítulo 6OcultarOcultar detallesVer detallesPipelines de Scrapy y almacenamiento de datos
Pipelines de Scrapy y almacenamiento de datos
Lección 1 • Exportación de datos a CSV y JSON
Usar los exportadores de alimentación integrados de Scrapy para escribir items en archivos planos. Las exportaciones a archivos planos son la ruta más rápida desde la araña hasta los datos utilizables.
Lección 2 • Escritura de componentes de pipeline personalizados
Construir clases de pipeline que limpien, dedupliquen o enriquezcan items antes del almacenamiento. Los pipelines personalizados manejan lógica que los exportadores no pueden expresar.
Lección 3 • Almacenamiento de datos en MongoDB
Escribir un pipeline que inserte items en una colección MongoDB usando PyMongo. El almacenamiento de documentos se adapta a datos extraídos con campos variables o anidados.
Lección 4 • Almacenamiento de datos en una base de datos SQL
Conectar un pipeline a una base de datos relacional e insertar items fila por fila. El almacenamiento en bases de datos permite consultas y gestión de datos a largo plazo.
Lección 5 • Comprensión de la arquitectura de pipelines
Trazar cómo fluyen los items desde las arañas a través de componentes de pipeline ordenados. Comprender este flujo es necesario para diseñar cadenas de procesamiento efectivas.
Capítulo 7OcultarOcultar detallesVer detallesManejo de medidas anti-scraping
Manejo de medidas anti-scraping
Lección 1 • Comprensión de las técnicas de detección de bots
Catalogar las señales del lado del servidor utilizadas para identificar tráfico automatizado. Conocer los métodos de detección informa las contramedidas aplicadas en secciones posteriores.
Lección 2 • Limitación de peticiones con AutoThrottle
Habilitar la extensión AutoThrottle de Scrapy para adaptar las tasas de peticiones a los tiempos de respuesta del servidor. El rastreo educado reduce el riesgo de prohibiciones por límite de tasa.
Lección 3 • Rotación de user-agents y cabeceras
Configurar middleware para aleatorizar cadenas de user-agent y cabeceras HTTP por petición. La rotación de cabeceras reduce la huella digital que activa la detección de bots.
Lección 4 • Uso de rotación de proxies
Enrutar peticiones a través de grupos de proxies rotativos para distribuir el tráfico entre múltiples direcciones IP. La rotación de proxies es la defensa principal contra las prohibiciones basadas en IP.
Lección 5 • Gestión de cookies y sesiones
Controlar el manejo de cookies para mantener sesiones o aislar peticiones según sea necesario. La gestión adecuada de sesiones previene bloqueos de muro de inicio de sesión y detección basada en sesiones.
Capítulo 8OcultarOcultar detallesVer detallesScraping de páginas renderizadas con JavaScript
Scraping de páginas renderizadas con JavaScript
Lección 1 • Manejo de desplazamiento infinito y carga diferida
Automatizar acciones de desplazamiento y activar eventos de carga diferida para exponer contenido oculto. Estas técnicas completan la extracción de conjuntos de datos en páginas modernas de estilo feed.
Lección 2 • Identificación de contenido renderizado con JavaScript
Distinguir entre HTML renderizado por el servidor y contenido renderizado por el cliente antes de elegir una estrategia de scraping. La identificación correcta previene el esfuerzo desperdiciado en el enfoque equivocado.
Lección 3 • Compensaciones de rendimiento de la automatización del navegador
Comparar la velocidad, el costo de recursos y la fiabilidad de los navegadores headless frente a las peticiones HTTP directas. Las decisiones informadas sobre compensaciones mantienen los proyectos mantenibles y eficientes.
Lección 4 • Integración de Scrapy con Playwright
Usar la librería scrapy-playwright para renderizar JavaScript dentro del pipeline de peticiones de Scrapy. La integración de Playwright maneja sitios donde la interceptación de API no es factible.
Lección 5 • Interceptación directa de llamadas API
Realizar ingeniería inversa de las peticiones API subyacentes que realiza un navegador y llamarlas directamente con Scrapy. Las llamadas directas a la API son más rápidas y estables que la automatización del navegador.
Tu certificado válido de finalización
Este curso es para ti:
Aspirantes a analistas de datos: necesitan conjuntos de datos reales sin depender de proveedores externos.
Aficionados a Python: listos para ir más allá de los tutoriales y construir algo realmente útil.
Desarrolladores freelance: quieren ofrecer la recolección automatizada de datos como un servicio facturable.
Personas en transición profesional: apuntan a roles de datos o backend y necesitan un proyecto concreto para su portafolio.
Investigadores y académicos: deben recopilar datos web repetidamente sin copiar y pegar manualmente.
Propietarios de pequeños negocios: quieren monitorear a la competencia o agregar información del mercado automáticamente.
Lo que dicen nuestros estudiantes
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Ecuador?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















