
Formation en web scraping
Apprenez à collecter des données à partir de n'importe quel site Web avec Python — des pages HTML statiques aux applications JavaScript lourdes. Ce cours couvre toute la pile d'aspiration, y compris l'analyse, le stockage, la neutralisation des robots et la conception de pipelines évolutifs. Vous terminerez avec des aspirateurs réels et déployables et les compétences nécessaires pour en construire d'autres.
Ce que vous allez apprendre:
Vous commencerez par configurer un environnement Python professionnel et comprendre comment le Web achemine les données. De là, vous utiliserez BeautifulSoup et requests pour extraire des données de pages statiques, puis passerez à l'automatisation de navigateur avec Selenium et Playwright pour les sites dynamiques. Vous apprendrez à stocker les données récupérées dans des fichiers CSV, JSON et des bases de données SQLite. Le cours couvre également le contournement des mesures anti-aspiration comme les CAPTCHAs, les blocages IP et les murs de connexion. Enfin, vous créerez des pipelines planifiés et concurrents avec Scrapy et asyncio, et explorerez le déploiement en nuage et les techniques d'extraction assistées par IA.
Comment vous étudiez de façon pratique Formation en web scraping
Comment vous pratiquez Formation en web scraping
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'extraction de données Web et configuration de l'environnement
Fondements de l'extraction de données Web et configuration de l'environnement
Leçon 1 • Comment le Web livre les données
Couvre les cycles requête-réponse HTTP, les codes d'état et les en-têtes. Établit les connaissances en couche réseau nécessaires pour chaque technique d'extraction du cours.
Leçon 2 • Principes essentiels de la structure HTML et CSS
Présente la structure de l'arbre DOM, les balises HTML et les sélecteurs CSS. Fournit la littératie en balisage nécessaire pour localiser et extraire les données cibles de toute page Web.
Leçon 3 • Considérations éthiques et juridiques
Examine robots.txt, les conditions d'utilisation et les taux d'exploration responsables. Définit les limites éthiques qui guident chaque décision pratique prise tout au long du cours.
Leçon 4 • Configuration de l'environnement Python
Configure Python, les environnements virtuels et les bibliothèques essentielles. Assure un espace de travail reproductible et isolé avant d'écrire du code d'extraction.
Chapitre 2MasquerCacher les détailsVoir les détailsRécupération de pages Web avec Requests
Récupération de pages Web avec Requests
Leçon 1 • Travailler avec les formats de réponse
Analyse les réponses JSON, XML et binaires renvoyées par les serveurs. Prépare les étudiants à gérer divers types de contenu au-delà des pages HTML standard.
Leçon 2 • Gestion des en-têtes et des sessions
Enseigne les en-têtes personnalisés, les chaînes user-agent et les objets session pour les connexions persistantes. Permet aux extracteurs d'imiter le comportement d'un navigateur et de maintenir l'état entre les requêtes.
Leçon 3 • Gestion des délais d'attente et des erreurs
Aborde la configuration des délais d'attente, la logique de nouvelle tentative et la gestion des erreurs HTTP. Construit des extracteurs résilients qui se rétablissent gracieusement après des défaillances réseau.
Leçon 4 • Effectuer des requêtes HTTP de base
Couvre les requêtes GET et POST, le passage de paramètres et la lecture du contenu de la réponse. Forme le modèle de récupération de base utilisé dans tous les projets d'extraction ultérieurs.
Chapitre 3MasquerCacher les détailsVoir les détailsAnalyse HTML avec BeautifulSoup
Analyse HTML avec BeautifulSoup
Leçon 1 • Création et navigation dans l'arbre d'analyse
Présente la création d'objets BeautifulSoup, les analyseurs et les méthodes de parcours d'arbre. Établit les compétences de navigation fondamentales utilisées dans chaque tâche d'extraction.
Leçon 2 • Requêtes de sélecteur CSS
Applique select et select_one avec la syntaxe des sélecteurs CSS pour un ciblage concis des éléments. Complète les recherches par balise avec un style de requête plus expressif.
Leçon 3 • Recherche d'éléments par balise et attribut
Couvre find, find_all et les recherches basées sur les attributs. Permet un ciblage précis des éléments, quelle que soit la complexité de la page.
Leçon 4 • Extraction de texte, de liens et d'attributs
Récupère le contenu textuel, les valeurs href, les sources d'images et d'autres attributs des éléments correspondants. Produit les données brutes qui alimentent le stockage et l'analyse en aval.
Leçon 5 • Gestion du HTML malformé et imbriqué
Aborde le balisage brisé, les structures profondément imbriquées et les problèmes d'encodage. Assure une analyse robuste même lorsque le code source HTML s'écarte des normes.
Chapitre 4MasquerCacher les détailsVoir les détailsExtraction de pages JavaScript dynamiques
Extraction de pages JavaScript dynamiques
Leçon 1 • Automatisation du navigateur avec Selenium
Couvre la configuration de WebDriver, l'interaction avec les éléments et la navigation dans les pages avec Selenium. Fournit une base d'automatisation largement adoptée pour les tâches d'extraction dynamique.
Leçon 2 • Pourquoi les extracteurs statiques échouent sur les pages dynamiques
Explique le rendu côté client, les applications à page unique et le chargement différé. Motive le passage à l'automatisation du navigateur pour les cibles JavaScript lourdes.
Leçon 3 • Automatisation moderne avec Playwright
Présente l'API asynchrone de Playwright, l'attente automatique et la prise en charge multi-navigateurs. Offre une alternative plus rapide et plus fiable à Selenium pour les applications Web modernes.
Leçon 4 • Interaction avec des éléments d'interface utilisateur complexes
Gère les listes déroulantes, les fenêtres modales, le défilement infini et la pagination dans les navigateurs automatisés. Étend les compétences d'automatisation aux modèles d'interaction réels avec les pages.
Leçon 5 • Interception des requêtes réseau
Utilise le protocole des outils de développement du navigateur et l'interception de routes de Playwright pour capturer les appels API. Permet l'extraction directe de données à partir des API sous-jacentes plutôt qu'à partir du HTML rendu.
Chapitre 5MasquerCacher les détailsVoir les détailsModèles et techniques d'extraction de données
Modèles et techniques d'extraction de données
Leçon 1 • Utilisation d'expressions régulières pour le nettoyage des données
Applique des motifs d'expressions régulières pour nettoyer, valider et transformer les chaînes extraites brutes. Fait le pont entre le texte extrait désordonné et les données structurées et utilisables.
Leçon 2 • Extraction de listes et de structures répétées
Extrait des données des motifs ul, ol et div répétés courants dans les listes de produits et d'articles. Construit une logique d'extraction par boucle applicable à toute disposition basée sur des listes.
Leçon 3 • Gestion des données manquantes et incohérentes
Aborde les champs facultatifs, les valeurs nulles et les variations de mise en page entre les pages. Produit des pipelines d'extraction qui restent stables lorsque les pages sources diffèrent.
Leçon 4 • Extraction de données tabulaires
Analyse les tableaux HTML en lignes et colonnes structurées à l'aide de BeautifulSoup et pandas. Produit des DataFrames propres prêts pour l'analyse ou l'exportation.
Leçon 5 • Suivi de liens et exploration de plusieurs pages
Implémente une logique de suivi de liens pour parcourir les sites paginés et hiérarchiques. Fait passer l'extraction d'une seule page à l'exploration complète d'un site.
Chapitre 6MasquerCacher les détailsVoir les détailsStockage et exportation des données extraites
Stockage et exportation des données extraites
Leçon 1 • Utilisation de pandas pour la transformation des données
Charge les données extraites dans des DataFrames pour le nettoyage, la déduplication et le remodelage. Prépare les ensembles de données pour l'analyse en aval ou l'exportation vers plusieurs formats.
Leçon 2 • Sauvegarde des données dans des fichiers CSV et JSON
Écrit les enregistrements extraits dans des fichiers plats à l'aide du module csv et de la bibliothèque json de Python. Établit le format de stockage le plus simple et le plus portable pour les ensembles de données extraits.
Leçon 3 • Stockage de données dans des bases de données SQLite
Crée des schémas SQLite, insère des enregistrements et interroge les données stockées avec le module sqlite3 de Python. Introduit le stockage relationnel pour des ensembles de données structurés et interrogeables.
Leçon 4 • Stockage incrémental et dédupliqué
Implémente une logique d'insertion-remplacement et de détection des changements pour éviter de stocker des enregistrements en double entre les exécutions. Permet aux extracteurs à longue durée de vie d'accumuler des données sans redondance.
Chapitre 7MasquerCacher les détailsVoir les détailsContournement des obstacles courants à l'extraction
Contournement des obstacles courants à l'extraction
Leçon 1 • Compréhension des mécanismes anti-extraction
Examine les techniques de détection de robots, y compris la prise d'empreintes numériques, les pièges (honeypots) et l'analyse comportementale. Fournit un modèle de menace qui éclaire chaque contre-mesure du chapitre.
Leçon 2 • Résolution et évitement des CAPTCHA
Couvre les types de CAPTCHA, les services de résolution tiers et les stratégies d'évitement. Fournit des options pratiques pour maintenir l'accès de l'extracteur lorsque des CAPTCHA sont rencontrés.
Leçon 3 • Rotation des mandataires et gestion des IP
Configure des pools de mandataires, fait pivoter les IP par requête et gère gracieusement les échecs de mandataire. Empêche les blocages basés sur IP lors des tâches d'extraction à volume élevé.
Leçon 4 • Gestion de la connexion et de l'authentification par session
Automatise la connexion par formulaire, les flux OAuth et la maintenance de session basée sur les cookies. Déverrouille l'accès au contenu authentifié derrière les murs de connexion.
Leçon 5 • Gestion des en-têtes et des empreintes numériques du navigateur
Randomise les user-agents, les en-têtes d'acceptation et les attributs du navigateur pour réduire le risque de détection. Complète la rotation des mandataires avec des techniques d'évasion au niveau de l'identité.
Chapitre 8MasquerCacher les détailsVoir les détailsConstruction de pipelines d'extraction évolutifs
Construction de pipelines d'extraction évolutifs
Leçon 1 • Planification et automatisation des exécutions d'extraction
Planifie les extracteurs avec cron, les files d'attente de tâches et les fonctions infonuagiques pour une exécution récurrente. Supprime l'intervention manuelle des flux de travail de collecte de données.
Leçon 2 • Maintenance des extracteurs face aux changements de site
Détecte les changements de mise en page, automatise les tests de régression et documente les sélecteurs pour des mises à jour rapides. Réduit le coût de maintenance lorsque les sites cibles remodèlent leurs pages.
Leçon 3 • Surveillance, journalisation et alertes
Implémente la journalisation structurée, les alertes d'erreur et les tableaux de bord d'état des extracteurs. Assure que les extracteurs de production signalent les échecs avant qu'ils n'affectent les consommateurs de données en aval.
Leçon 4 • Construction d'extracteurs avec le cadriciel Scrapy
Présente les araignées (spiders), les éléments (items), les pipelines et les intergiciels de Scrapy. Fournit un cadriciel de niveau production qui gère la concurrence, les nouvelles tentatives et le stockage automatiquement.
Leçon 5 • Concurrence avec Threading et Asyncio
Applique le threading et asyncio pour exécuter plusieurs requêtes en parallèle. Réduit considérablement le temps d'extraction pour les grands ensembles d'URL sans surcharger les serveurs cibles.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste de données : a besoin d'une collecte de données automatisée pour remplacer les exportations manuelles lentes.
Passionné de Python : souhaite construire de vrais projets au-delà des tutoriels et des scripts d'exercice.
Développeur pigiste : cherche à offrir des services de données Web à des clients payants.
Chercheur : nécessite des ensembles de données frais et structurés qu'aucune source publique ne fournit.
Personne en réorientation de carrière : vise à intégrer des postes en données avec une compétence technique démontrable.
Professionnel du marketing : cherche à suivre les prix et le contenu des concurrents à grande échelle.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















