
Curso de Web Scraping com Python e Scrapy
Aprenda a coletar dados de qualquer site usando Python e Scrapy — um dos frameworks de raspagem de dados web mais poderosos disponíveis. Este curso leva você da configuração do ambiente até a criação de spiders prontos para produção que lidam com paginação, medidas antibot e páginas renderizadas por JavaScript. Ao final, você terá um projeto de portfólio e as habilidades práticas para automatizar a coleta de dados em escala.
O que você vai aprender:
Configure um ambiente de desenvolvimento profissional em Python e Scrapy do zero.
Crie spiders que seguem links de paginação e rastreiam sites inteiros com várias páginas automaticamente.
Extraia, limpe e armazene dados estruturados em CSV, JSON, SQLite e MongoDB.
Aplique rotação de proxies, falsificação de user-agent e AutoThrottle para contornar defesas comuns contra raspagem de dados.
Raspe páginas renderizadas por JavaScript e aplicações de página única usando integração com Playwright.
Faça design de projetos de raspagem completos com pipelines reutilizáveis, esquemas de itens e agendamento automatizado.
Como você estuda de forma prática Curso de Web Scraping com Python e Scrapy
Como você pratica Curso de Web Scraping com Python e Scrapy
Pra você que é empresa e quer treinar o time
Na Dedika para empresas, o curso vem com exercícios e exemplos do próprio negócio e do jeito que a sua empresa precisa.
Conteúdo do curso
8 Capítulos • 37 AulasDuração entre 4 e 360 horas (você decide)
Capítulo 1EsconderEsconder detalhesVer detalhesConfiguração do ambiente Python e Scrapy
Configuração do ambiente Python e Scrapy
Aula 1 • Ambientes Virtuais para Projetos Python
Crie ambientes virtuais isolados para gerenciar as dependências do projeto de forma limpa. O isolamento impede conflitos de pacotes entre múltiplos projetos.
Aula 2 • Configuração do Editor de Código para Projetos Scrapy
Configure um editor de código com suporte a Python, linting e realce de sintaxe. As ferramentas adequadas aceleram o desenvolvimento e reduzem erros de sintaxe.
Aula 3 • Instalando o Scrapy e Suas Dependências
Instale o Scrapy via pip e resolva problemas comuns de dependência. Uma instalação limpa confirma que o ambiente está pronto para o desenvolvimento de spiders.
Aula 4 • Instalação e Configuração do Python
Instale o Python e configure as variáveis PATH para acesso pela linha de comando. Uma configuração correta aqui previne erros de ambiente ao longo do curso.
Capítulo 2EsconderEsconder detalhesVer detalhesFundamentos da Web para Raspadores
Fundamentos da Web para Raspadores
Aula 1 • DevTools do Navegador para Pesquisa de Scrapers
Use as ferramentas de desenvolvedor do navegador para inspecionar elementos, monitorar o tráfego de rede de computadores e copiar seletores. Este fluxo de trabalho de pesquisa informa diretamente o design do spider.
Aula 2 • Expressões XPath para Seleção Avançada
Escreva expressões XPath para navegar pelo DOM com mais flexibilidade do que apenas CSS. XPath lida com padrões de travessia complexos que o CSS não consegue expressar.
Aula 3 • Como as requisições HTTP e as respostas funcionam
Rastreie o lifecycle de uma requisição HTTP do navegador ao servidor e de volta. Este modelo explica o que o Scrapy replica ao buscar páginas.
Aula 4 • Seletores CSS para Segmentação de Dados
Use a sintaxe de seletores CSS para identificar elementos específicos dentro de um documento HTML. Esses seletores são a principal ferramenta de segmentação nas spiders do Scrapy.
Aula 5 • Estrutura do HTML e o DOM
Leia e interprete documentos HTML como estruturas de árvore aninhadas. Compreender o DOM é essencial para escrever seletores CSS e XPath precisos.
Capítulo 3EsconderEsconder detalhesVer detalhesConstruindo Sua Primeira Aranha Scrapy
Construindo Sua Primeira Aranha Scrapy
Aula 1 • Executando e Depurando Spiders
Execute spiders com o comando scrapy crawl e interprete a saída do log. Habilidades de depuração reduzem o tempo gasto com spiders quebrados.
Aula 2 • Anatomia de uma classe Spider do Scrapy
Examine a classe Spider básica e seus atributos e métodos exigidos. Toda spider herda essa estrutura, portanto dominá-la é fundamental.
Aula 3 • Extraindo Dados com Seletores
Aplique seletores CSS e XPath dentro do método de análise para extrair texto e atributos. A extração precisa é a habilidade essencial de qualquer spider.
Aula 4 • Explicação da Estrutura de Projeto do Scrapy
Gere um projeto Scrapy e entenda a função de cada arquivo gerado. Conhecer a estrutura evita erros de configuração e código fora de lugar.
Capítulo 4EsconderEsconder detalhesVer detalhesScrapy Items e Modelagem de Dados
Scrapy Items e Modelagem de Dados
Aula 1 • Limpeza de Dados com Processadores
Escreva funções de processador personalizadas para extrair, converter e normalizar valores de campos. Limpar dados no nível do carregador reduz a complexidade do pipeline downstream.
Aula 2 • Definindo Ítens do Scrapy
Declare classes de Item com campos tipados para representar registros raspados. Itens impõem um esquema consistente em todas as spiders de um projeto.
Aula 3 • Usando ItemLoaders para Dados Limpos
Aplique ItemLoaders para automatizar o processamento de entrada e saída em valores de campo. Os loaders separam a lógica de extração da lógica de limpeza para facilitar a manutenção.
Aula 4 • Validando Dados Raspados
Adicione validação em nível de campo para capturar registros malformados antes que cheguem ao armazenamento. A validação precoce impede que dados corrompidos entrem nos pipelines.
Capítulo 5EsconderEsconder detalhesVer detalhesRastreando Várias Páginas e Sites
Rastreando Várias Páginas e Sites
Aula 1 • Seguindo Links com Requests do Scrapy
Produza objetos scrapy.Request a partir dos métodos de análise para instruir o rastreador a buscar URLs adicionais. O acompanhamento de links é o mecanismo por trás dos rastreamentos completos de sites.
Aula 2 • Usando CrawlSpider para Crawling Baseado em Regras
Aproveite a subclasse CrawlSpider e os objetos Rule para definir padrões de seguimento de links de forma declarativa. As Rules reduzem código repetitivo para sites grandes e estruturados.
Aula 3 • Gerenciando a Profundidade de Crawl e o Escopo
Configure limites de profundidade e filtros de URL para manter os crawls focados e eficientes. O controle de escopo impede crawls descontrolados que desperdiçam recursos.
Aula 4 • Estratégias de Paginação
Detecte e siga links de próxima página em esquemas de paginação numerada e baseada em cursor. Lidar com a paginação permite a extração completa do conjunto de dados.
Aula 5 • Passando Dados Entre Requisições
Use os dicionários cb_kwargs e meta para carregar contexto de uma requisição para a próxima. O contexto compartilhado possibilita a montagem de registros de várias páginas.
Capítulo 6EsconderEsconder detalhesVer detalhesPipelines do Scrapy e Armazenamento de Dados
Pipelines do Scrapy e Armazenamento de Dados
Aula 1 • Exportando Dados para CSV e JSON
Use os exportadores de feed integrados do Scrapy para escrever itens em arquivos simples. As exportações para arquivos simples são o caminho mais rápido da aranha até os dados utilizáveis.
Aula 2 • Escrevendo Componentes de Pipeline Personalizados
Crie classes de pipeline que limpam, removem duplicatas ou enriquecem itens antes do armazenamento. Pipelines personalizados lidam com lógica que exportadores não conseguem expressar.
Aula 3 • Armazenando Dados no MongoDB
Escreva um pipeline que faça a inserção de itens em uma coleção MongoDB usando PyMongo. O armazenamento em documentos é adequado para dados raspados com campos variáveis ou aninhados.
Aula 4 • Armazenando Dados em um Banco de Dados SQL
Conecte um pipeline a um banco de dados relacional e insira itens linha por linha. O armazenamento de banco de dados permite consultas e gerenciamento de dados a longo prazo.
Aula 5 • Compreendendo a Arquitetura de Pipeline
Rastreie como os itens fluem das spiders através dos componentes ordenados do pipeline. Compreender esse fluxo é exigido para projetar cadeias de processamento eficazes.
Capítulo 7EsconderEsconder detalhesVer detalhesLidando com Medidas Antirraspagem
Lidando com Medidas Antirraspagem
Aula 1 • Compreendendo Técnicas de Detecção de Bots
Catálogo dos sinais do lado do servidor usados para identificar tráfego automatizado. Conhecer os métodos de detecção informa as contramedidas aplicadas nas seções posteriores.
Aula 2 • Limitando Requests com AutoThrottle
Ative a extensão AutoThrottle do Scrapy para adaptar as taxas de requisição aos tempos de resposta do servidor. Um rastreamento educado reduz o risco de bans por limite de taxa.
Aula 3 • Rotação de Agentes de Usuário e Cabeçalhos
Configure o middleware para randomizar as strings de user-agent e os cabeçalhos HTTP por requisição. A rotação de cabeçalhos reduz a impressão digital que aciona a detecção de bots.
Aula 4 • Usando Rotação de Proxy
Roteie as requisições através de pools de proxy rotativos para distribuir o tráfego entre múltiplos endereços IP. A rotação de proxy é a principal defesa contra bloqueios baseados em IP.
Aula 5 • Gerenciando Cookies e Sessões
Controle o manuseio de cookies para manter sessões ou isolar requisições conforme necessário. O gerenciamento adequado de sessão evita blocos de login e detecção baseada em sessão.
Capítulo 8EsconderEsconder detalhesVer detalhesRaspagem de Páginas Renderizadas por JavaScript
Raspagem de Páginas Renderizadas por JavaScript
Aula 1 • Manipulando rolagem infinita e carregamento preguiçoso
Automatize ações de rolar e dispare eventos de carregamento sob demanda para expor conteúdo oculto. Essas técnicas completam a extração do conjunto de dados em páginas modernas no estilo feed.
Aula 2 • Identificando Conteúdo Renderizado por JavaScript
Diferencie entre HTML renderizado no servidor e conteúdo renderizado no cliente antes de escolher uma estratégia de raspagem. A identificação correta evita esforço desperdiçado na abordagem errada.
Aula 3 • Trade-offs de Desempenho da Automação de Navegadores
Compare a velocidade, o custo de recursos e a confiabilidade dos navegadores headless com os requests HTTP diretos. Decisões de trade-off informadas mantêm os projetos manuteníveis e eficientes.
Aula 4 • Integrando Scrapy com Playwright
Use a biblioteca scrapy-playwright para renderizar JavaScript dentro do pipeline de requests do Scrapy. A integração com o Playwright lida com sites onde a interceptação da API não é viável.
Aula 5 • Interceptando Chamadas de API Diretamente
Faça engenharia reversa das requisições de API subjacentes que um navegador faz e chame-as diretamente com o Scrapy. Chamadas de API diretas são mais rápidas e estáveis do que a automação de navegador.
Seu certificado válido de conclusão
Este curso é para você:
Aspirantes a analistas de dados: precisam de conjuntos de dados reais sem depender de fornecedores terceirizados.
Entusiastas de Python: prontos para ir além dos tutoriais e construir algo realmente útil.
Desenvolvedores freelancers: querem oferecer coleta automatizada de dados como um serviço faturável.
Pessoas em transição de carreira: buscando funções de dados ou backend e precisam de um projeto concreto para o portfólio.
Pesquisadores e acadêmicos: precisam coletar dados da web repetidamente sem copiar e colar manualmente.
Pequenos empresários: querem monitorar concorrentes ou agregar informações de mercado automaticamente.
O que nossos alunos falam
As suas aulas são perfeitas. Adquiri o pacote de um ano e, finalmente, tenho a oportunidade de acompanhar diversos temas do meu interesse sem precisar mudar de plataforma... agradeço por tudo o que fazem, já recomendei vocês a outras pessoas...

Eu gosto de como as lições são direto ao ponto e como eu consigo alterar capítulos e pular conteúdos que não preciso.

Gosto do conteúdo e do modo de apresentação e transcrição de vídeos, o que acelera o processo!

A plataforma é rápida, simples de usar. A diversidade de conteúdo e os vídeos complementares ajudam muito no aprendizado.

Principais capacitações
FAQ
Quem é a Dedika?
O certificado é válido no Brasil?
Os cursos são gratuitos?
Qual a carga horária dos cursos?
Como são os cursos?
Como funcionam os cursos?
Qual é o tempo dos cursos?
Qual o valor ou preço dos cursos?
O que é um curso EAD ou online e como ele funciona?
Os cursos possuem PDF?




















