Escolha seu idioma
Curso de Web Scraping com Python e Scrapy
Mais de 2 milhões de alunos no mundo

Curso de Web Scraping com Python e Scrapy

Aprenda a coletar dados de qualquer site usando Python e Scrapy — um dos frameworks de raspagem de dados web mais poderosos disponíveis. Este curso leva você da configuração do ambiente até a criação de spiders prontos para produção que lidam com paginação, medidas antibot e páginas renderizadas por JavaScript. Ao final, você terá um projeto de portfólio e as habilidades práticas para automatizar a coleta de dados em escala.

Dedika para empresas

O que você vai aprender:

  • Configure um ambiente de desenvolvimento profissional em Python e Scrapy do zero.

  • Crie spiders que seguem links de paginação e rastreiam sites inteiros com várias páginas automaticamente.

  • Extraia, limpe e armazene dados estruturados em CSV, JSON, SQLite e MongoDB.

  • Aplique rotação de proxies, falsificação de user-agent e AutoThrottle para contornar defesas comuns contra raspagem de dados.

  • Raspe páginas renderizadas por JavaScript e aplicações de página única usando integração com Playwright.

  • Faça design de projetos de raspagem completos com pipelines reutilizáveis, esquemas de itens e agendamento automatizado.

Como você estuda de forma prática Curso de Web Scraping com Python e Scrapy

Como você pratica Curso de Web Scraping com Python e Scrapy

Pra você que é empresa e quer treinar o time

Na Dedika para empresas, o curso vem com exercícios e exemplos do próprio negócio e do jeito que a sua empresa precisa.

Clique aqui

Conteúdo do curso

8 Capítulos • 37 AulasDuração entre 4 e 360 horas (você decide)

Capítulo 1Ver detalhes

Configuração do ambiente Python e Scrapy

  • Aula 1 • Ambientes Virtuais para Projetos Python

    Crie ambientes virtuais isolados para gerenciar as dependências do projeto de forma limpa. O isolamento impede conflitos de pacotes entre múltiplos projetos.

  • Aula 2 • Configuração do Editor de Código para Projetos Scrapy

    Configure um editor de código com suporte a Python, linting e realce de sintaxe. As ferramentas adequadas aceleram o desenvolvimento e reduzem erros de sintaxe.

  • Aula 3 • Instalando o Scrapy e Suas Dependências

    Instale o Scrapy via pip e resolva problemas comuns de dependência. Uma instalação limpa confirma que o ambiente está pronto para o desenvolvimento de spiders.

  • Aula 4 • Instalação e Configuração do Python

    Instale o Python e configure as variáveis PATH para acesso pela linha de comando. Uma configuração correta aqui previne erros de ambiente ao longo do curso.

Capítulo 2Ver detalhes

Fundamentos da Web para Raspadores

  • Aula 1 • DevTools do Navegador para Pesquisa de Scrapers

    Use as ferramentas de desenvolvedor do navegador para inspecionar elementos, monitorar o tráfego de rede de computadores e copiar seletores. Este fluxo de trabalho de pesquisa informa diretamente o design do spider.

  • Aula 2 • Expressões XPath para Seleção Avançada

    Escreva expressões XPath para navegar pelo DOM com mais flexibilidade do que apenas CSS. XPath lida com padrões de travessia complexos que o CSS não consegue expressar.

  • Aula 3 • Como as requisições HTTP e as respostas funcionam

    Rastreie o lifecycle de uma requisição HTTP do navegador ao servidor e de volta. Este modelo explica o que o Scrapy replica ao buscar páginas.

  • Aula 4 • Seletores CSS para Segmentação de Dados

    Use a sintaxe de seletores CSS para identificar elementos específicos dentro de um documento HTML. Esses seletores são a principal ferramenta de segmentação nas spiders do Scrapy.

  • Aula 5 • Estrutura do HTML e o DOM

    Leia e interprete documentos HTML como estruturas de árvore aninhadas. Compreender o DOM é essencial para escrever seletores CSS e XPath precisos.

Capítulo 3Ver detalhes

Construindo Sua Primeira Aranha Scrapy

  • Aula 1 • Executando e Depurando Spiders

    Execute spiders com o comando scrapy crawl e interprete a saída do log. Habilidades de depuração reduzem o tempo gasto com spiders quebrados.

  • Aula 2 • Anatomia de uma classe Spider do Scrapy

    Examine a classe Spider básica e seus atributos e métodos exigidos. Toda spider herda essa estrutura, portanto dominá-la é fundamental.

  • Aula 3 • Extraindo Dados com Seletores

    Aplique seletores CSS e XPath dentro do método de análise para extrair texto e atributos. A extração precisa é a habilidade essencial de qualquer spider.

  • Aula 4 • Explicação da Estrutura de Projeto do Scrapy

    Gere um projeto Scrapy e entenda a função de cada arquivo gerado. Conhecer a estrutura evita erros de configuração e código fora de lugar.

Capítulo 4Ver detalhes

Scrapy Items e Modelagem de Dados

  • Aula 1 • Limpeza de Dados com Processadores

    Escreva funções de processador personalizadas para extrair, converter e normalizar valores de campos. Limpar dados no nível do carregador reduz a complexidade do pipeline downstream.

  • Aula 2 • Definindo Ítens do Scrapy

    Declare classes de Item com campos tipados para representar registros raspados. Itens impõem um esquema consistente em todas as spiders de um projeto.

  • Aula 3 • Usando ItemLoaders para Dados Limpos

    Aplique ItemLoaders para automatizar o processamento de entrada e saída em valores de campo. Os loaders separam a lógica de extração da lógica de limpeza para facilitar a manutenção.

  • Aula 4 • Validando Dados Raspados

    Adicione validação em nível de campo para capturar registros malformados antes que cheguem ao armazenamento. A validação precoce impede que dados corrompidos entrem nos pipelines.

Capítulo 5Ver detalhes

Rastreando Várias Páginas e Sites

  • Aula 1 • Seguindo Links com Requests do Scrapy

    Produza objetos scrapy.Request a partir dos métodos de análise para instruir o rastreador a buscar URLs adicionais. O acompanhamento de links é o mecanismo por trás dos rastreamentos completos de sites.

  • Aula 2 • Usando CrawlSpider para Crawling Baseado em Regras

    Aproveite a subclasse CrawlSpider e os objetos Rule para definir padrões de seguimento de links de forma declarativa. As Rules reduzem código repetitivo para sites grandes e estruturados.

  • Aula 3 • Gerenciando a Profundidade de Crawl e o Escopo

    Configure limites de profundidade e filtros de URL para manter os crawls focados e eficientes. O controle de escopo impede crawls descontrolados que desperdiçam recursos.

  • Aula 4 • Estratégias de Paginação

    Detecte e siga links de próxima página em esquemas de paginação numerada e baseada em cursor. Lidar com a paginação permite a extração completa do conjunto de dados.

  • Aula 5 • Passando Dados Entre Requisições

    Use os dicionários cb_kwargs e meta para carregar contexto de uma requisição para a próxima. O contexto compartilhado possibilita a montagem de registros de várias páginas.

Capítulo 6Ver detalhes

Pipelines do Scrapy e Armazenamento de Dados

  • Aula 1 • Exportando Dados para CSV e JSON

    Use os exportadores de feed integrados do Scrapy para escrever itens em arquivos simples. As exportações para arquivos simples são o caminho mais rápido da aranha até os dados utilizáveis.

  • Aula 2 • Escrevendo Componentes de Pipeline Personalizados

    Crie classes de pipeline que limpam, removem duplicatas ou enriquecem itens antes do armazenamento. Pipelines personalizados lidam com lógica que exportadores não conseguem expressar.

  • Aula 3 • Armazenando Dados no MongoDB

    Escreva um pipeline que faça a inserção de itens em uma coleção MongoDB usando PyMongo. O armazenamento em documentos é adequado para dados raspados com campos variáveis ou aninhados.

  • Aula 4 • Armazenando Dados em um Banco de Dados SQL

    Conecte um pipeline a um banco de dados relacional e insira itens linha por linha. O armazenamento de banco de dados permite consultas e gerenciamento de dados a longo prazo.

  • Aula 5 • Compreendendo a Arquitetura de Pipeline

    Rastreie como os itens fluem das spiders através dos componentes ordenados do pipeline. Compreender esse fluxo é exigido para projetar cadeias de processamento eficazes.

Capítulo 7Ver detalhes

Lidando com Medidas Antirraspagem

  • Aula 1 • Compreendendo Técnicas de Detecção de Bots

    Catálogo dos sinais do lado do servidor usados para identificar tráfego automatizado. Conhecer os métodos de detecção informa as contramedidas aplicadas nas seções posteriores.

  • Aula 2 • Limitando Requests com AutoThrottle

    Ative a extensão AutoThrottle do Scrapy para adaptar as taxas de requisição aos tempos de resposta do servidor. Um rastreamento educado reduz o risco de bans por limite de taxa.

  • Aula 3 • Rotação de Agentes de Usuário e Cabeçalhos

    Configure o middleware para randomizar as strings de user-agent e os cabeçalhos HTTP por requisição. A rotação de cabeçalhos reduz a impressão digital que aciona a detecção de bots.

  • Aula 4 • Usando Rotação de Proxy

    Roteie as requisições através de pools de proxy rotativos para distribuir o tráfego entre múltiplos endereços IP. A rotação de proxy é a principal defesa contra bloqueios baseados em IP.

  • Aula 5 • Gerenciando Cookies e Sessões

    Controle o manuseio de cookies para manter sessões ou isolar requisições conforme necessário. O gerenciamento adequado de sessão evita blocos de login e detecção baseada em sessão.

Capítulo 8Ver detalhes

Raspagem de Páginas Renderizadas por JavaScript

  • Aula 1 • Manipulando rolagem infinita e carregamento preguiçoso

    Automatize ações de rolar e dispare eventos de carregamento sob demanda para expor conteúdo oculto. Essas técnicas completam a extração do conjunto de dados em páginas modernas no estilo feed.

  • Aula 2 • Identificando Conteúdo Renderizado por JavaScript

    Diferencie entre HTML renderizado no servidor e conteúdo renderizado no cliente antes de escolher uma estratégia de raspagem. A identificação correta evita esforço desperdiçado na abordagem errada.

  • Aula 3 • Trade-offs de Desempenho da Automação de Navegadores

    Compare a velocidade, o custo de recursos e a confiabilidade dos navegadores headless com os requests HTTP diretos. Decisões de trade-off informadas mantêm os projetos manuteníveis e eficientes.

  • Aula 4 • Integrando Scrapy com Playwright

    Use a biblioteca scrapy-playwright para renderizar JavaScript dentro do pipeline de requests do Scrapy. A integração com o Playwright lida com sites onde a interceptação da API não é viável.

  • Aula 5 • Interceptando Chamadas de API Diretamente

    Faça engenharia reversa das requisições de API subjacentes que um navegador faz e chame-as diretamente com o Scrapy. Chamadas de API diretas são mais rápidas e estáveis do que a automação de navegador.

Certificação

Seu certificado válido de conclusão

Este curso é para você:

  • Aspirantes a analistas de dados: precisam de conjuntos de dados reais sem depender de fornecedores terceirizados.

  • Entusiastas de Python: prontos para ir além dos tutoriais e construir algo realmente útil.

  • Desenvolvedores freelancers: querem oferecer coleta automatizada de dados como um serviço faturável.

  • Pessoas em transição de carreira: buscando funções de dados ou backend e precisam de um projeto concreto para o portfólio.

  • Pesquisadores e acadêmicos: precisam coletar dados da web repetidamente sem copiar e colar manualmente.

  • Pequenos empresários: querem monitorar concorrentes ou agregar informações de mercado automaticamente.

O que nossos alunos falam

As suas aulas são perfeitas. Adquiri o pacote de um ano e, finalmente, tenho a oportunidade de acompanhar diversos temas do meu interesse sem precisar mudar de plataforma... agradeço por tudo o que fazem, já recomendei vocês a outras pessoas...
Giulio Carlo
Giulio CarloAluno de Marketing Digital
Eu gosto de como as lições são direto ao ponto e como eu consigo alterar capítulos e pular conteúdos que não preciso.
Mariana Ferres
Mariana FerresAluna de Fotografia
Gosto do conteúdo e do modo de apresentação e transcrição de vídeos, o que acelera o processo!
Luciana Alvarenga
Luciana AlvarengaAluna de Design de Unhas
A plataforma é rápida, simples de usar. A diversidade de conteúdo e os vídeos complementares ajudam muito no aprendizado.
André Felipe
André FelipeAluno de Engenharia de Prompt

Principais capacitações

FAQ

Quem é a Dedika?

O certificado é válido no Brasil?

Os cursos são gratuitos?

Qual a carga horária dos cursos?

Como são os cursos?

Como funcionam os cursos?

Qual é o tempo dos cursos?

Qual o valor ou preço dos cursos?

O que é um curso EAD ou online e como ele funciona?

Os cursos possuem PDF?