Choisissez votre langue
Formation en web scraping
Plus de 2 millions d'apprenants dans le monde

Formation en web scraping

Apprenez à collecter des données à partir de n'importe quel site Web avec Python — des pages HTML statiques aux applications JavaScript lourdes. Ce cours couvre toute la pile d'aspiration, y compris l'analyse, le stockage, la neutralisation des robots et la conception de pipelines évolutifs. Vous terminerez avec des aspirateurs réels et déployables et les compétences nécessaires pour en construire d'autres.

Dedika pour entreprises

Ce que vous allez apprendre:

Vous commencerez par configurer un environnement Python professionnel et comprendre comment le Web achemine les données. De là, vous utiliserez BeautifulSoup et requests pour extraire des données de pages statiques, puis passerez à l'automatisation de navigateur avec Selenium et Playwright pour les sites dynamiques. Vous apprendrez à stocker les données récupérées dans des fichiers CSV, JSON et des bases de données SQLite. Le cours couvre également le contournement des mesures anti-aspiration comme les CAPTCHAs, les blocages IP et les murs de connexion. Enfin, vous créerez des pipelines planifiés et concurrents avec Scrapy et asyncio, et explorerez le déploiement en nuage et les techniques d'extraction assistées par IA.

Comment vous étudiez de façon pratique Formation en web scraping

Comment vous pratiquez Formation en web scraping

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'extraction de données Web et configuration de l'environnement

  • Leçon 1 • Comment le Web livre les données

    Couvre les cycles requête-réponse HTTP, les codes d'état et les en-têtes. Établit les connaissances en couche réseau nécessaires pour chaque technique d'extraction du cours.

  • Leçon 2 • Principes essentiels de la structure HTML et CSS

    Présente la structure de l'arbre DOM, les balises HTML et les sélecteurs CSS. Fournit la littératie en balisage nécessaire pour localiser et extraire les données cibles de toute page Web.

  • Leçon 3 • Considérations éthiques et juridiques

    Examine robots.txt, les conditions d'utilisation et les taux d'exploration responsables. Définit les limites éthiques qui guident chaque décision pratique prise tout au long du cours.

  • Leçon 4 • Configuration de l'environnement Python

    Configure Python, les environnements virtuels et les bibliothèques essentielles. Assure un espace de travail reproductible et isolé avant d'écrire du code d'extraction.

Chapitre 2Voir les détails

Récupération de pages Web avec Requests

  • Leçon 1 • Travailler avec les formats de réponse

    Analyse les réponses JSON, XML et binaires renvoyées par les serveurs. Prépare les étudiants à gérer divers types de contenu au-delà des pages HTML standard.

  • Leçon 2 • Gestion des en-têtes et des sessions

    Enseigne les en-têtes personnalisés, les chaînes user-agent et les objets session pour les connexions persistantes. Permet aux extracteurs d'imiter le comportement d'un navigateur et de maintenir l'état entre les requêtes.

  • Leçon 3 • Gestion des délais d'attente et des erreurs

    Aborde la configuration des délais d'attente, la logique de nouvelle tentative et la gestion des erreurs HTTP. Construit des extracteurs résilients qui se rétablissent gracieusement après des défaillances réseau.

  • Leçon 4 • Effectuer des requêtes HTTP de base

    Couvre les requêtes GET et POST, le passage de paramètres et la lecture du contenu de la réponse. Forme le modèle de récupération de base utilisé dans tous les projets d'extraction ultérieurs.

Chapitre 3Voir les détails

Analyse HTML avec BeautifulSoup

  • Leçon 1 • Création et navigation dans l'arbre d'analyse

    Présente la création d'objets BeautifulSoup, les analyseurs et les méthodes de parcours d'arbre. Établit les compétences de navigation fondamentales utilisées dans chaque tâche d'extraction.

  • Leçon 2 • Requêtes de sélecteur CSS

    Applique select et select_one avec la syntaxe des sélecteurs CSS pour un ciblage concis des éléments. Complète les recherches par balise avec un style de requête plus expressif.

  • Leçon 3 • Recherche d'éléments par balise et attribut

    Couvre find, find_all et les recherches basées sur les attributs. Permet un ciblage précis des éléments, quelle que soit la complexité de la page.

  • Leçon 4 • Extraction de texte, de liens et d'attributs

    Récupère le contenu textuel, les valeurs href, les sources d'images et d'autres attributs des éléments correspondants. Produit les données brutes qui alimentent le stockage et l'analyse en aval.

  • Leçon 5 • Gestion du HTML malformé et imbriqué

    Aborde le balisage brisé, les structures profondément imbriquées et les problèmes d'encodage. Assure une analyse robuste même lorsque le code source HTML s'écarte des normes.

Chapitre 4Voir les détails

Extraction de pages JavaScript dynamiques

  • Leçon 1 • Automatisation du navigateur avec Selenium

    Couvre la configuration de WebDriver, l'interaction avec les éléments et la navigation dans les pages avec Selenium. Fournit une base d'automatisation largement adoptée pour les tâches d'extraction dynamique.

  • Leçon 2 • Pourquoi les extracteurs statiques échouent sur les pages dynamiques

    Explique le rendu côté client, les applications à page unique et le chargement différé. Motive le passage à l'automatisation du navigateur pour les cibles JavaScript lourdes.

  • Leçon 3 • Automatisation moderne avec Playwright

    Présente l'API asynchrone de Playwright, l'attente automatique et la prise en charge multi-navigateurs. Offre une alternative plus rapide et plus fiable à Selenium pour les applications Web modernes.

  • Leçon 4 • Interaction avec des éléments d'interface utilisateur complexes

    Gère les listes déroulantes, les fenêtres modales, le défilement infini et la pagination dans les navigateurs automatisés. Étend les compétences d'automatisation aux modèles d'interaction réels avec les pages.

  • Leçon 5 • Interception des requêtes réseau

    Utilise le protocole des outils de développement du navigateur et l'interception de routes de Playwright pour capturer les appels API. Permet l'extraction directe de données à partir des API sous-jacentes plutôt qu'à partir du HTML rendu.

Chapitre 5Voir les détails

Modèles et techniques d'extraction de données

  • Leçon 1 • Utilisation d'expressions régulières pour le nettoyage des données

    Applique des motifs d'expressions régulières pour nettoyer, valider et transformer les chaînes extraites brutes. Fait le pont entre le texte extrait désordonné et les données structurées et utilisables.

  • Leçon 2 • Extraction de listes et de structures répétées

    Extrait des données des motifs ul, ol et div répétés courants dans les listes de produits et d'articles. Construit une logique d'extraction par boucle applicable à toute disposition basée sur des listes.

  • Leçon 3 • Gestion des données manquantes et incohérentes

    Aborde les champs facultatifs, les valeurs nulles et les variations de mise en page entre les pages. Produit des pipelines d'extraction qui restent stables lorsque les pages sources diffèrent.

  • Leçon 4 • Extraction de données tabulaires

    Analyse les tableaux HTML en lignes et colonnes structurées à l'aide de BeautifulSoup et pandas. Produit des DataFrames propres prêts pour l'analyse ou l'exportation.

  • Leçon 5 • Suivi de liens et exploration de plusieurs pages

    Implémente une logique de suivi de liens pour parcourir les sites paginés et hiérarchiques. Fait passer l'extraction d'une seule page à l'exploration complète d'un site.

Chapitre 6Voir les détails

Stockage et exportation des données extraites

  • Leçon 1 • Utilisation de pandas pour la transformation des données

    Charge les données extraites dans des DataFrames pour le nettoyage, la déduplication et le remodelage. Prépare les ensembles de données pour l'analyse en aval ou l'exportation vers plusieurs formats.

  • Leçon 2 • Sauvegarde des données dans des fichiers CSV et JSON

    Écrit les enregistrements extraits dans des fichiers plats à l'aide du module csv et de la bibliothèque json de Python. Établit le format de stockage le plus simple et le plus portable pour les ensembles de données extraits.

  • Leçon 3 • Stockage de données dans des bases de données SQLite

    Crée des schémas SQLite, insère des enregistrements et interroge les données stockées avec le module sqlite3 de Python. Introduit le stockage relationnel pour des ensembles de données structurés et interrogeables.

  • Leçon 4 • Stockage incrémental et dédupliqué

    Implémente une logique d'insertion-remplacement et de détection des changements pour éviter de stocker des enregistrements en double entre les exécutions. Permet aux extracteurs à longue durée de vie d'accumuler des données sans redondance.

Chapitre 7Voir les détails

Contournement des obstacles courants à l'extraction

  • Leçon 1 • Compréhension des mécanismes anti-extraction

    Examine les techniques de détection de robots, y compris la prise d'empreintes numériques, les pièges (honeypots) et l'analyse comportementale. Fournit un modèle de menace qui éclaire chaque contre-mesure du chapitre.

  • Leçon 2 • Résolution et évitement des CAPTCHA

    Couvre les types de CAPTCHA, les services de résolution tiers et les stratégies d'évitement. Fournit des options pratiques pour maintenir l'accès de l'extracteur lorsque des CAPTCHA sont rencontrés.

  • Leçon 3 • Rotation des mandataires et gestion des IP

    Configure des pools de mandataires, fait pivoter les IP par requête et gère gracieusement les échecs de mandataire. Empêche les blocages basés sur IP lors des tâches d'extraction à volume élevé.

  • Leçon 4 • Gestion de la connexion et de l'authentification par session

    Automatise la connexion par formulaire, les flux OAuth et la maintenance de session basée sur les cookies. Déverrouille l'accès au contenu authentifié derrière les murs de connexion.

  • Leçon 5 • Gestion des en-têtes et des empreintes numériques du navigateur

    Randomise les user-agents, les en-têtes d'acceptation et les attributs du navigateur pour réduire le risque de détection. Complète la rotation des mandataires avec des techniques d'évasion au niveau de l'identité.

Chapitre 8Voir les détails

Construction de pipelines d'extraction évolutifs

  • Leçon 1 • Planification et automatisation des exécutions d'extraction

    Planifie les extracteurs avec cron, les files d'attente de tâches et les fonctions infonuagiques pour une exécution récurrente. Supprime l'intervention manuelle des flux de travail de collecte de données.

  • Leçon 2 • Maintenance des extracteurs face aux changements de site

    Détecte les changements de mise en page, automatise les tests de régression et documente les sélecteurs pour des mises à jour rapides. Réduit le coût de maintenance lorsque les sites cibles remodèlent leurs pages.

  • Leçon 3 • Surveillance, journalisation et alertes

    Implémente la journalisation structurée, les alertes d'erreur et les tableaux de bord d'état des extracteurs. Assure que les extracteurs de production signalent les échecs avant qu'ils n'affectent les consommateurs de données en aval.

  • Leçon 4 • Construction d'extracteurs avec le cadriciel Scrapy

    Présente les araignées (spiders), les éléments (items), les pipelines et les intergiciels de Scrapy. Fournit un cadriciel de niveau production qui gère la concurrence, les nouvelles tentatives et le stockage automatiquement.

  • Leçon 5 • Concurrence avec Threading et Asyncio

    Applique le threading et asyncio pour exécuter plusieurs requêtes en parallèle. Réduit considérablement le temps d'extraction pour les grands ensembles d'URL sans surcharger les serveurs cibles.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste de données : a besoin d'une collecte de données automatisée pour remplacer les exportations manuelles lentes.

  • Passionné de Python : souhaite construire de vrais projets au-delà des tutoriels et des scripts d'exercice.

  • Développeur pigiste : cherche à offrir des services de données Web à des clients payants.

  • Chercheur : nécessite des ensembles de données frais et structurés qu'aucune source publique ne fournit.

  • Personne en réorientation de carrière : vise à intégrer des postes en données avec une compétence technique démontrable.

  • Professionnel du marketing : cherche à suivre les prix et le contenu des concurrents à grande échelle.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF