
Corso Base di Web Scraping con Python e Scrapy
Impari a raccogliere dati da qualsiasi sito web utilizzando Python e Scrapy — uno dei framework di web scraping più potenti disponibili. Questo corso La guida dalla configurazione dell'ambiente fino alla realizzazione di spider pronti per la produzione, in grado di gestire la paginazione, le misure anti-bot e le pagine renderizzate con JavaScript. Alla fine, avrà un progetto di portfolio e le competenze pratiche per automatizzare la raccolta dati su larga scala.
Cosa imparerai:
Configuri un ambiente di sviluppo professionale per Python e Scrapy partendo da zero.
Costruisca spider che seguono automaticamente i link di paginazione ed esplorano interi siti web multi-pagina.
Estragga, pulisca e archivi dati strutturati in CSV, JSON, SQLite e MongoDB.
Applichi la rotazione dei proxy, lo spoofing dell'user-agent e AutoThrottle per aggirare le difese anti-scraping più comuni.
Effettui lo scraping di pagine renderizzate con JavaScript e di applicazioni a pagina singola utilizzando l'integrazione con Playwright.
Progettare progetti di scraping end-to-end con pipeline riutilizzabili, schemi di item e schedulazione automatica.
Come studi in modo pratico Corso Base di Web Scraping con Python e Scrapy
Come metti in pratica Corso Base di Web Scraping con Python e Scrapy
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 37 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliConfigurazione dell'ambiente Python e Scrapy
Configurazione dell'ambiente Python e Scrapy
Lezione 1 • Ambienti virtuali per progetti Python
Creare ambienti virtuali isolati per gestire le dipendenze di progetto in modo pulito. L'isolamento previene conflitti di pacchetto tra più progetti.
Lezione 2 • Configurazione dell'editor di codice per progetti Scrapy
Configurare un editor di codice con supporto Python, linting ed evidenziazione della sintassi. Una strumentazione adeguata accelera lo sviluppo e riduce gli errori di sintassi.
Lezione 3 • Installare Scrapy e le sue dipendenze
Installare Scrapy tramite pip e risolvere i problemi comuni delle dipendenze. Un'installazione pulita conferma che l'ambiente è pronto per lo sviluppo di spider.
Lezione 4 • Installazione e configurazione di Python
Installare Python e configurare le variabili PATH per l'accesso da riga di comando. Una configurazione corretta qui previene errori di ambiente durante tutto il corso.
Capitolo 2NascondiNascondi dettagliVedi dettagliFondamenti web per scraper
Fondamenti web per scraper
Lezione 1 • DevTools del browser per la ricerca nello scraping
Utilizzare gli strumenti di sviluppo del browser per ispezionare gli elementi, monitorare il traffico di rete e copiare i selettori. Questo flusso di lavoro di ricerca informa direttamente la progettazione dello spider.
Lezione 2 • Espressioni XPath per la selezione avanzata
Scrivere espressioni XPath per navigare il DOM con maggiore flessibilità rispetto al solo CSS. XPath gestisce pattern di attraversamento complessi che i CSS non possono esprimere.
Lezione 3 • Come funzionano le richieste e le risposte HTTP
Tracciare il ciclo di vita di una richiesta HTTP dal browser al server e ritorno. Questo modello spiega cosa replica Scrapy quando recupera le pagine.
Lezione 4 • Selettori CSS per l'individuazione dei dati
Utilizzare la sintassi dei selettori CSS per individuare elementi specifici all'interno di un documento HTML. Questi selettori sono lo strumento di individuazione principale negli spider Scrapy.
Lezione 5 • Struttura HTML e il DOM
Leggere e interpretare i documenti HTML come strutture ad albero annidate. Comprendere il DOM è essenziale per scrivere selettori CSS e XPath accurati.
Capitolo 3NascondiNascondi dettagliVedi dettagliCostruire il primo spider Scrapy
Costruire il primo spider Scrapy
Lezione 1 • Esecuzione e debug degli spider
Eseguire gli spider con il comando scrapy crawl e interpretare l'output del log. Le competenze di debug riducono il tempo speso su spider non funzionanti.
Lezione 2 • Anatomia di una classe Spider Scrapy
Esaminare la classe base Spider e i suoi attributi e metodi richiesti. Ogni spider eredita questa struttura, quindi padroneggiarla è fondamentale.
Lezione 3 • Estrarre dati con i selettori
Applicare i selettori CSS e XPath all'interno del metodo parse per estrarre testo e attributi. Un'estrazione accurata è la competenza principale di qualsiasi spider.
Lezione 4 • Struttura del progetto Scrapy spiegata
Generare un progetto Scrapy e comprendere il ruolo di ogni file generato. Conoscere la struttura previene errori di posizionamento del codice e di configurazione.
Capitolo 4NascondiNascondi dettagliVedi dettagliItem Scrapy e modellazione dei dati
Item Scrapy e modellazione dei dati
Lezione 1 • Pulizia dei dati con i processori
Scrivere funzioni di processore personalizzate per rimuovere spazi, convertire tipi e normalizzare i valori dei campi. Dati puliti a livello di loader riducono la complessità della pipeline a valle.
Lezione 2 • Definire gli Item Scrapy
Dichiarare classi Item con campi tipizzati per rappresentare i record estratti. Gli Item impongono uno schema coerente su tutti gli spider di un progetto.
Lezione 3 • Utilizzare gli ItemLoader per dati puliti
Applicare gli ItemLoader per automatizzare l'elaborazione di input e output sui valori dei campi. I loader separano la logica di estrazione dalla logica di pulizia per una migliore manutenibilità.
Lezione 4 • Validazione dei dati estratti
Aggiungere validazione a livello di campo per intercettare record malformati prima che raggiungano lo storage. La validazione precoce previene l'ingresso di dati corrotti nelle pipeline.
Capitolo 5NascondiNascondi dettagliVedi dettagliCrawl di più pagine e siti
Crawl di più pagine e siti
Lezione 1 • Seguire i link con le richieste Scrapy
Generare oggetti scrapy.Request dai metodi parse per istruire il crawler a recuperare URL aggiuntivi. Il seguire i link è il meccanismo alla base dei crawl dell'intero sito.
Lezione 2 • Utilizzare CrawlSpider per crawl basati su regole
Sfruttare la sottoclasse CrawlSpider e gli oggetti Rule per definire pattern di follow dei link in modo dichiarativo. Le regole riducono il codice ripetitivo per siti grandi e strutturati.
Lezione 3 • Gestire profondità e ambito del crawl
Configurare limiti di profondità e filtri URL per mantenere il crawl focalizzato ed efficiente. Il controllo dell'ambito previene crawl fuori controllo che spreca risorse.
Lezione 4 • Strategie di impaginazione
Rilevare e seguire i link alla pagina successiva attraverso schemi di impaginazione numerica e a cursore. Gestire l'impaginazione consente l'estrazione completa del dataset.
Lezione 5 • Passare dati tra le richieste
Utilizzare i dizionari cb_kwargs e meta per trasportare il contesto da una richiesta all'altra. Il contesto condiviso consente l'assemblaggio di record multipagina.
Capitolo 6NascondiNascondi dettagliVedi dettagliPipeline Scrapy e archiviazione dei dati
Pipeline Scrapy e archiviazione dei dati
Lezione 1 • Esportare dati in CSV e JSON
Utilizzare gli esportatori feed integrati di Scrapy per scrivere gli item su file piatti. Le esportazioni su file piatto sono il percorso più rapido dallo spider ai dati utilizzabili.
Lezione 2 • Scrivere componenti di pipeline personalizzati
Costruire classi di pipeline che puliscono, deduplicano o arricchiscono gli item prima dell'archiviazione. Le pipeline personalizzate gestiscono la logica che gli esportatori non possono esprimere.
Lezione 3 • Archiviare dati in MongoDB
Scrivere una pipeline che inserisce gli item in una collezione MongoDB utilizzando PyMongo. L'archiviazione documentale si adatta a dati estratti con campi variabili o annidati.
Lezione 4 • Archiviare dati in un database SQL
Connettere una pipeline a un database relazionale e inserire gli item riga per riga. L'archiviazione in database consente la query e la gestione dei dati a lungo termine.
Lezione 5 • Comprendere l'architettura della pipeline
Tracciare come gli item fluiscono dagli spider attraverso i componenti ordinati della pipeline. Comprendere questo flusso è necessario per progettare catene di elaborazione efficaci.
Capitolo 7NascondiNascondi dettagliVedi dettagliGestire le misure anti-scraping
Gestire le misure anti-scraping
Lezione 1 • Comprendere le tecniche di rilevamento bot
Catalogare i segnali lato server utilizzati per identificare il traffico automatizzato. Conoscere i metodi di rilevamento informa le contromisure applicate nelle sezioni successive.
Lezione 2 • Limitazione delle richieste con AutoThrottle
Abilitare l'estensione AutoThrottle di Scrapy per adattare le frequenze di richiesta ai tempi di risposta del server. Un crawl educato riduce il rischio di ban per limite di velocità.
Lezione 3 • Ruotare user agent e intestazioni
Configurare il middleware per randomizzare le stringhe user-agent e le intestazioni HTTP per ogni richiesta. La rotazione delle intestazioni riduce l'impronta digitale che attiva il rilevamento bot.
Lezione 4 • Utilizzare la rotazione dei proxy
Instradare le richieste attraverso pool di proxy rotanti per distribuire il traffico su più indirizzi IP. La rotazione dei proxy è la difesa primaria contro i ban basati su IP.
Lezione 5 • Gestire cookie e sessioni
Controllare la gestione dei cookie per mantenere le sessioni o isolare le richieste secondo necessità. Una corretta gestione delle sessioni previene i blocchi da login e il rilevamento basato sulla sessione.
Capitolo 8NascondiNascondi dettagliVedi dettagliEseguire lo scraping di pagine renderizzate con JavaScript
Eseguire lo scraping di pagine renderizzate con JavaScript
Lezione 1 • Gestire lo scorrimento infinito e il caricamento lento
Automatizzare le azioni di scorrimento e attivare gli eventi di caricamento lento per esporre contenuti nascosti. Queste tecniche completano l'estrazione del dataset su moderne pagine in stile feed.
Lezione 2 • Identificare i contenuti renderizzati con JavaScript
Distinguere tra HTML renderizzato lato server e contenuto renderizzato lato client prima di scegliere una strategia di scraping. Un'identificazione corretta previene sforzi inutili sull'approccio sbagliato.
Lezione 3 • Trade-off di prestazioni dell'automazione del browser
Confrontare la velocità, il costo in risorse e l'affidabilità dei browser headless rispetto alle richieste HTTP dirette. Decisioni informate sui trade-off mantengono i progetti manutenibili ed efficienti.
Lezione 4 • Integrare Scrapy con Playwright
Utilizzare la libreria scrapy-playwright per renderizzare JavaScript all'interno della pipeline di richieste di Scrapy. L'integrazione con Playwright gestisce i siti dove l'intercettazione API non è fattibile.
Lezione 5 • Intercettare direttamente le chiamate API
Effettuare il reverse engineering delle richieste API sottostanti che un browser effettua e chiamarle direttamente con Scrapy. Le chiamate API dirette sono più veloci e più stabili dell'automazione del browser.
Il tuo certificato valido di completamento
Questo corso è per te:
Aspiranti analisti di dati: hanno bisogno di dataset reali senza dover dipendere da fornitori terzi.
Appassionati di Python: pronti a superare i tutorial e a costruire qualcosa di veramente utile.
Sviluppatori freelance: desiderano offrire la raccolta automatizzata di dati come servizio fatturabile.
Persone in fase di cambiamento di carriera: puntano a ruoli legati ai dati o al backend e necessitano di un progetto concreto per il portfolio.
Ricercatori e accademici: devono raccogliere dati dal web ripetutamente senza copia-incolla manuali.
Proprietari di piccole imprese: desiderano monitorare la concorrenza o aggregare informazioni di mercato in modo automatico.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















