Choisissez votre langue
Formation en web scraping
Plus de 2 millions d'apprenants dans le monde

Formation en web scraping

Apprenez à collecter des données à partir de n'importe quel site web avec Python — des pages HTML statiques aux applications JavaScript lourdes. Ce cours couvre l'ensemble de la pile de scraping, y compris l'analyse, le stockage, l'évitement anti-bot et la conception de pipelines évolutifs. Vous obtiendrez des scrapers réels et déployables ainsi que les compétences pour en construire d'autres.

Dedika pour entreprises

Ce que vous allez apprendre:

Vous commencerez par configurer un environnement Python professionnel et comprendre comment le web diffuse les données. Ensuite, vous utiliserez BeautifulSoup et requests pour extraire des données de pages statiques, puis vous passerez à l'automatisation des navigateurs avec Selenium et Playwright pour les sites dynamiques. Vous apprendrez à stocker les données extraites dans des fichiers CSV, JSON et des bases de données SQLite. Le cours couvre également le contournement des mesures anti-scraping comme les CAPTCHAs, les blocages IP et les murs de connexion. Enfin, vous construirez des pipelines concurrents et planifiés avec Scrapy et asyncio, et explorerez le déploiement dans le nuage et les techniques d'extraction assistées par IA.

Comment vous étudiez de façon pratique Formation en web scraping

Comment vous pratiquez Formation en web scraping

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux de l'extraction de données web et configuration de l'environnement

  • Leçon 1 • Comment le web fournit les données

    Couvre les cycles requête-réponse HTTP, les codes d'état et les en-têtes. Établit les connaissances de la couche réseau nécessaires pour chaque technique d'extraction du cours.

  • Leçon 2 • Éléments essentiels de la structure HTML et CSS

    Présente la structure de l'arbre DOM, les balises HTML et les sélecteurs CSS. Fournit la maîtrise du balisage nécessaire pour localiser et extraire les données cibles de n'importe quelle page web.

  • Leçon 3 • Considérations éthiques et juridiques

    Examine robots.txt, les conditions d'utilisation et les taux d'exploration responsables. Encadre les limites éthiques qui guident chaque décision pratique prise tout au long du cours.

  • Leçon 4 • Configuration de l'environnement Python

    Configure Python, les environnements virtuels et les bibliothèques logicielles essentielles. Garantit un espace de travail reproductible et isolé avant l'écriture de tout code d'extraction.

Chapitre 2Voir les détails

Récupération de pages web avec Requests

  • Leçon 1 • Travailler avec les formats de réponse

    Analyse les réponses JSON, XML et binaires renvoyées par les serveurs. Prépare les étudiants à gérer divers types de contenu au-delà des pages HTML standard.

  • Leçon 2 • Gestion des en-têtes et des sessions

    Enseigne les en-têtes personnalisés, les chaînes user-agent et les objets de session pour les connexions persistantes. Permet aux extracteurs d'imiter le comportement d'un navigateur et de maintenir l'état entre les requêtes.

  • Leçon 3 • Gestion des délais d'attente et des erreurs

    Traite de la configuration des délais d'attente, de la logique de nouvelle tentative et de la gestion des erreurs HTTP. Construit des extracteurs résilients qui récupèrent gracieusement des pannes réseau.

  • Leçon 4 • Effectuer des requêtes HTTP de base

    Couvre les requêtes GET et POST, le passage de paramètres et la lecture du contenu de la réponse. Forme le modèle de récupération central utilisé dans tous les projets d'extraction ultérieurs.

Chapitre 3Voir les détails

Analyse du HTML avec BeautifulSoup

  • Leçon 1 • Création et navigation dans l'arbre d'analyse

    Présente la création d'objets BeautifulSoup, les analyseurs et les méthodes de parcours de l'arbre. Établit les compétences fondamentales de navigation utilisées dans chaque tâche d'extraction.

  • Leçon 2 • Requêtes de sélecteur CSS

    Applique select et select_one avec la syntaxe des sélecteurs CSS pour un ciblage concis des éléments. Complète les recherches par balise avec un style de requête plus expressif.

  • Leçon 3 • Recherche d'éléments par balise et attribut

    Couvre find, find_all et les recherches par attribut. Permet un ciblage précis des éléments quelle que soit la complexité de la page.

  • Leçon 4 • Extraction de texte, de liens et d'attributs

    Récupère le contenu textuel, les valeurs href, les sources d'images et d'autres attributs à partir des éléments correspondants. Produit les données brutes qui alimentent le stockage et l'analyse en aval.

  • Leçon 5 • Gestion du HTML mal formé et imbriqué

    Traite du balisage défectueux, des structures profondément imbriquées et des problèmes d'encodage. Garantit une analyse robuste même lorsque le HTML source s'écarte des normes.

Chapitre 4Voir les détails

Extraction de pages JavaScript dynamiques

  • Leçon 1 • Automatisation du navigateur avec Selenium

    Couvre la configuration de WebDriver, l'interaction avec les éléments et la navigation dans les pages avec Selenium. Fournit une base d'automatisation largement adoptée pour les tâches d'extraction dynamique.

  • Leçon 2 • Pourquoi les extracteurs statiques échouent sur les pages dynamiques

    Explique le rendu côté client, les applications à page unique et le chargement différé. Justifie le passage à l'automatisation du navigateur pour les cibles JavaScript lourdes.

  • Leçon 3 • Automatisation moderne avec Playwright

    Présente l'API asynchrone de Playwright, l'attente automatique et la prise en charge multi-navigateurs. Offre une alternative plus rapide et plus fiable à Selenium pour les applications web modernes.

  • Leçon 4 • Interaction avec des éléments d'interface utilisateur complexes

    Gère les listes déroulantes, les modales, le défilement infini et la pagination dans les navigateurs automatisés. Étend les compétences d'automatisation aux modèles d'interaction de page du monde réel.

  • Leçon 5 • Interception des requêtes réseau

    Utilise le protocole des outils de développement du navigateur et l'interception de route de Playwright pour capturer les appels API. Permet l'extraction directe de données à partir des API sous-jacentes au lieu du HTML rendu.

Chapitre 5Voir les détails

Modèles et techniques d'extraction de données

  • Leçon 1 • Utilisation des expressions régulières pour le nettoyage des données

    Applique des motifs regex pour nettoyer, valider et transformer les chaînes brutes extraites. Fait le pont entre le texte extrait désordonné et les données structurées et utilisables.

  • Leçon 2 • Extraction de listes et de structures répétées

    Extrait les données des motifs ul, ol et div répétés courants dans les listes de produits et d'articles. Construit une logique d'extraction en boucle applicable à toute mise en page basée sur des listes.

  • Leçon 3 • Gestion des données manquantes et incohérentes

    Traite les champs facultatifs, les valeurs nulles et les variations de mise en page entre les pages. Produit des pipelines d'extraction qui restent stables lorsque les pages sources diffèrent.

  • Leçon 4 • Extraction de données tabulaires

    Analyse les tableaux HTML en lignes et colonnes structurées à l'aide de BeautifulSoup et pandas. Produit des DataFrames propres prêts pour l'analyse ou l'exportation.

  • Leçon 5 • Suivi de liens et exploration de plusieurs pages

    Implémente une logique de suivi de liens pour parcourir les sites paginés et hiérarchiques. Transforme l'extraction d'une seule page en exploration complète du site.

Chapitre 6Voir les détails

Stockage et exportation des données extraites

  • Leçon 1 • Utilisation de pandas pour la transformation des données

    Charge les données extraites dans des DataFrames pour le nettoyage, la déduplication et le remodelage. Prépare les ensembles de données pour l'analyse en aval ou l'exportation vers plusieurs formats.

  • Leçon 2 • Sauvegarde des données dans des fichiers CSV et JSON

    Écrit les enregistrements extraits dans des fichiers plats à l'aide du module csv et de la bibliothèque logicielle json de Python. Établit le format de stockage le plus simple et le plus portable pour les ensembles de données extraits.

  • Leçon 3 • Stockage des données dans des bases de données SQLite

    Crée des schémas SQLite, insère des enregistrements et interroge les données stockées avec le module sqlite3 de Python. Introduit le stockage relationnel pour des ensembles de données structurés et interrogeables.

  • Leçon 4 • Stockage incrémental et dédupliqué

    Implémente une logique d'upsert et de détection des changements pour éviter de stocker des enregistrements en double entre les exécutions. Permet aux extracteurs à long terme d'accumuler des données sans redondance.

Chapitre 7Voir les détails

Contournement des obstacles courants à l'extraction

  • Leçon 1 • Compréhension des mécanismes anti-extraction

    Passe en revue les techniques de détection de bots, y compris l'empreinte numérique, les honeypots et l'analyse comportementale. Fournit un modèle de menace qui éclaire chaque contre-mesure du chapitre.

  • Leçon 2 • Résolution et contournement des CAPTCHA

    Couvre les types de CAPTCHA, les services de résolution tiers et les stratégies d'évitement. Fournit des options pratiques pour maintenir l'accès de l'extracteur lorsque des CAPTCHA sont rencontrés.

  • Leçon 3 • Rotation des proxies et gestion des IP

    Configure des pools de proxies, fait tourner les IP par requête et gère gracieusement les pannes de proxy. Prévient les blocages basés sur l'IP lors de tâches d'extraction à volume élevé.

  • Leçon 4 • Gestion de la connexion et de l'authentification par session

    Automatise la connexion basée sur les formulaires, les flux OAuth et la maintenance de session basée sur les cookies. Débloque l'accès au contenu authentifié derrière les murs de connexion.

  • Leçon 5 • Gestion des en-têtes et des empreintes numériques du navigateur

    Randomise les user-agents, les en-têtes d'acceptation et les attributs du navigateur pour réduire le risque de détection. Complète la rotation des proxies par des techniques d'évasion au niveau de l'identité.

Chapitre 8Voir les détails

Construction de pipelines d'extraction évolutifs

  • Leçon 1 • Planification et automatisation des exécutions d'extraction

    Planifie les extracteurs avec cron, les files d'attente de tâches et les fonctions cloud pour une exécution récurrente. Supprime l'intervention manuelle des flux de travail de collecte de données.

  • Leçon 2 • Maintenance des extracteurs face aux changements de site

    Détecte les changements de mise en page, automatise les tests de régression et documente les sélecteurs pour des mises à jour rapides. Réduit le coût de maintenance lorsque les sites cibles refont leur mise en page.

  • Leçon 3 • Surveillance, journalisation et alerte

    Implémente la journalisation structurée, les alertes d'erreur et les tableaux de bord d'état de santé des extracteurs. Garantit que les extracteurs de production signalent les défaillances avant qu'elles n'affectent les consommateurs de données en aval.

  • Leçon 4 • Construction d'extracteurs avec le Framework Scrapy

    Présente les spiders, items, pipelines et intergiciels de Scrapy. Fournit un framework de niveau production qui gère la concurrence, les nouvelles tentatives et le stockage automatiquement.

  • Leçon 5 • Concurrence avec le threading et asyncio

    Applique le threading et asyncio pour exécuter plusieurs requêtes en parallèle. Réduit considérablement le temps d'extraction pour les grands ensembles d'URL sans surcharger les serveurs cibles.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste de données : a besoin d'une collecte de données automatisée pour remplacer les exports manuels lents.

  • Passionné de Python : souhaite construire de vrais projets au-delà des tutoriels et des scripts d'exemple.

  • Développeur freelance : cherche à proposer des services de données web à des clients payants.

  • Chercheur : nécessite des ensembles de données frais et structurés qu'aucune source publique ne fournit.

  • Personne en reconversion professionnelle : vise à accéder à des postes dans le domaine des données avec une compétence technique démontrable.

  • Professionnel du marketing : cherche à suivre les prix et le contenu des concurrents à grande échelle.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Cameroun ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF