
Formation en web scraping
Apprenez à collecter des données à partir de n'importe quel site web avec Python — des pages HTML statiques aux applications JavaScript lourdes. Ce cours couvre l'ensemble de la pile de scraping, y compris l'analyse, le stockage, l'évitement anti-bot et la conception de pipelines évolutifs. Vous obtiendrez des scrapers réels et déployables ainsi que les compétences pour en construire d'autres.
Ce que vous allez apprendre:
Vous commencerez par configurer un environnement Python professionnel et comprendre comment le web diffuse les données. Ensuite, vous utiliserez BeautifulSoup et requests pour extraire des données de pages statiques, puis vous passerez à l'automatisation des navigateurs avec Selenium et Playwright pour les sites dynamiques. Vous apprendrez à stocker les données extraites dans des fichiers CSV, JSON et des bases de données SQLite. Le cours couvre également le contournement des mesures anti-scraping comme les CAPTCHAs, les blocages IP et les murs de connexion. Enfin, vous construirez des pipelines concurrents et planifiés avec Scrapy et asyncio, et explorerez le déploiement dans le nuage et les techniques d'extraction assistées par IA.
Comment vous étudiez de façon pratique Formation en web scraping
Comment vous pratiquez Formation en web scraping
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux de l'extraction de données web et configuration de l'environnement
Fondamentaux de l'extraction de données web et configuration de l'environnement
Leçon 1 • Comment le web fournit les données
Couvre les cycles requête-réponse HTTP, les codes d'état et les en-têtes. Établit les connaissances de la couche réseau nécessaires pour chaque technique d'extraction du cours.
Leçon 2 • Éléments essentiels de la structure HTML et CSS
Présente la structure de l'arbre DOM, les balises HTML et les sélecteurs CSS. Fournit la maîtrise du balisage nécessaire pour localiser et extraire les données cibles de n'importe quelle page web.
Leçon 3 • Considérations éthiques et juridiques
Examine robots.txt, les conditions d'utilisation et les taux d'exploration responsables. Encadre les limites éthiques qui guident chaque décision pratique prise tout au long du cours.
Leçon 4 • Configuration de l'environnement Python
Configure Python, les environnements virtuels et les bibliothèques logicielles essentielles. Garantit un espace de travail reproductible et isolé avant l'écriture de tout code d'extraction.
Chapitre 2MasquerCacher les détailsVoir les détailsRécupération de pages web avec Requests
Récupération de pages web avec Requests
Leçon 1 • Travailler avec les formats de réponse
Analyse les réponses JSON, XML et binaires renvoyées par les serveurs. Prépare les étudiants à gérer divers types de contenu au-delà des pages HTML standard.
Leçon 2 • Gestion des en-têtes et des sessions
Enseigne les en-têtes personnalisés, les chaînes user-agent et les objets de session pour les connexions persistantes. Permet aux extracteurs d'imiter le comportement d'un navigateur et de maintenir l'état entre les requêtes.
Leçon 3 • Gestion des délais d'attente et des erreurs
Traite de la configuration des délais d'attente, de la logique de nouvelle tentative et de la gestion des erreurs HTTP. Construit des extracteurs résilients qui récupèrent gracieusement des pannes réseau.
Leçon 4 • Effectuer des requêtes HTTP de base
Couvre les requêtes GET et POST, le passage de paramètres et la lecture du contenu de la réponse. Forme le modèle de récupération central utilisé dans tous les projets d'extraction ultérieurs.
Chapitre 3MasquerCacher les détailsVoir les détailsAnalyse du HTML avec BeautifulSoup
Analyse du HTML avec BeautifulSoup
Leçon 1 • Création et navigation dans l'arbre d'analyse
Présente la création d'objets BeautifulSoup, les analyseurs et les méthodes de parcours de l'arbre. Établit les compétences fondamentales de navigation utilisées dans chaque tâche d'extraction.
Leçon 2 • Requêtes de sélecteur CSS
Applique select et select_one avec la syntaxe des sélecteurs CSS pour un ciblage concis des éléments. Complète les recherches par balise avec un style de requête plus expressif.
Leçon 3 • Recherche d'éléments par balise et attribut
Couvre find, find_all et les recherches par attribut. Permet un ciblage précis des éléments quelle que soit la complexité de la page.
Leçon 4 • Extraction de texte, de liens et d'attributs
Récupère le contenu textuel, les valeurs href, les sources d'images et d'autres attributs à partir des éléments correspondants. Produit les données brutes qui alimentent le stockage et l'analyse en aval.
Leçon 5 • Gestion du HTML mal formé et imbriqué
Traite du balisage défectueux, des structures profondément imbriquées et des problèmes d'encodage. Garantit une analyse robuste même lorsque le HTML source s'écarte des normes.
Chapitre 4MasquerCacher les détailsVoir les détailsExtraction de pages JavaScript dynamiques
Extraction de pages JavaScript dynamiques
Leçon 1 • Automatisation du navigateur avec Selenium
Couvre la configuration de WebDriver, l'interaction avec les éléments et la navigation dans les pages avec Selenium. Fournit une base d'automatisation largement adoptée pour les tâches d'extraction dynamique.
Leçon 2 • Pourquoi les extracteurs statiques échouent sur les pages dynamiques
Explique le rendu côté client, les applications à page unique et le chargement différé. Justifie le passage à l'automatisation du navigateur pour les cibles JavaScript lourdes.
Leçon 3 • Automatisation moderne avec Playwright
Présente l'API asynchrone de Playwright, l'attente automatique et la prise en charge multi-navigateurs. Offre une alternative plus rapide et plus fiable à Selenium pour les applications web modernes.
Leçon 4 • Interaction avec des éléments d'interface utilisateur complexes
Gère les listes déroulantes, les modales, le défilement infini et la pagination dans les navigateurs automatisés. Étend les compétences d'automatisation aux modèles d'interaction de page du monde réel.
Leçon 5 • Interception des requêtes réseau
Utilise le protocole des outils de développement du navigateur et l'interception de route de Playwright pour capturer les appels API. Permet l'extraction directe de données à partir des API sous-jacentes au lieu du HTML rendu.
Chapitre 5MasquerCacher les détailsVoir les détailsModèles et techniques d'extraction de données
Modèles et techniques d'extraction de données
Leçon 1 • Utilisation des expressions régulières pour le nettoyage des données
Applique des motifs regex pour nettoyer, valider et transformer les chaînes brutes extraites. Fait le pont entre le texte extrait désordonné et les données structurées et utilisables.
Leçon 2 • Extraction de listes et de structures répétées
Extrait les données des motifs ul, ol et div répétés courants dans les listes de produits et d'articles. Construit une logique d'extraction en boucle applicable à toute mise en page basée sur des listes.
Leçon 3 • Gestion des données manquantes et incohérentes
Traite les champs facultatifs, les valeurs nulles et les variations de mise en page entre les pages. Produit des pipelines d'extraction qui restent stables lorsque les pages sources diffèrent.
Leçon 4 • Extraction de données tabulaires
Analyse les tableaux HTML en lignes et colonnes structurées à l'aide de BeautifulSoup et pandas. Produit des DataFrames propres prêts pour l'analyse ou l'exportation.
Leçon 5 • Suivi de liens et exploration de plusieurs pages
Implémente une logique de suivi de liens pour parcourir les sites paginés et hiérarchiques. Transforme l'extraction d'une seule page en exploration complète du site.
Chapitre 6MasquerCacher les détailsVoir les détailsStockage et exportation des données extraites
Stockage et exportation des données extraites
Leçon 1 • Utilisation de pandas pour la transformation des données
Charge les données extraites dans des DataFrames pour le nettoyage, la déduplication et le remodelage. Prépare les ensembles de données pour l'analyse en aval ou l'exportation vers plusieurs formats.
Leçon 2 • Sauvegarde des données dans des fichiers CSV et JSON
Écrit les enregistrements extraits dans des fichiers plats à l'aide du module csv et de la bibliothèque logicielle json de Python. Établit le format de stockage le plus simple et le plus portable pour les ensembles de données extraits.
Leçon 3 • Stockage des données dans des bases de données SQLite
Crée des schémas SQLite, insère des enregistrements et interroge les données stockées avec le module sqlite3 de Python. Introduit le stockage relationnel pour des ensembles de données structurés et interrogeables.
Leçon 4 • Stockage incrémental et dédupliqué
Implémente une logique d'upsert et de détection des changements pour éviter de stocker des enregistrements en double entre les exécutions. Permet aux extracteurs à long terme d'accumuler des données sans redondance.
Chapitre 7MasquerCacher les détailsVoir les détailsContournement des obstacles courants à l'extraction
Contournement des obstacles courants à l'extraction
Leçon 1 • Compréhension des mécanismes anti-extraction
Passe en revue les techniques de détection de bots, y compris l'empreinte numérique, les honeypots et l'analyse comportementale. Fournit un modèle de menace qui éclaire chaque contre-mesure du chapitre.
Leçon 2 • Résolution et contournement des CAPTCHA
Couvre les types de CAPTCHA, les services de résolution tiers et les stratégies d'évitement. Fournit des options pratiques pour maintenir l'accès de l'extracteur lorsque des CAPTCHA sont rencontrés.
Leçon 3 • Rotation des proxies et gestion des IP
Configure des pools de proxies, fait tourner les IP par requête et gère gracieusement les pannes de proxy. Prévient les blocages basés sur l'IP lors de tâches d'extraction à volume élevé.
Leçon 4 • Gestion de la connexion et de l'authentification par session
Automatise la connexion basée sur les formulaires, les flux OAuth et la maintenance de session basée sur les cookies. Débloque l'accès au contenu authentifié derrière les murs de connexion.
Leçon 5 • Gestion des en-têtes et des empreintes numériques du navigateur
Randomise les user-agents, les en-têtes d'acceptation et les attributs du navigateur pour réduire le risque de détection. Complète la rotation des proxies par des techniques d'évasion au niveau de l'identité.
Chapitre 8MasquerCacher les détailsVoir les détailsConstruction de pipelines d'extraction évolutifs
Construction de pipelines d'extraction évolutifs
Leçon 1 • Planification et automatisation des exécutions d'extraction
Planifie les extracteurs avec cron, les files d'attente de tâches et les fonctions cloud pour une exécution récurrente. Supprime l'intervention manuelle des flux de travail de collecte de données.
Leçon 2 • Maintenance des extracteurs face aux changements de site
Détecte les changements de mise en page, automatise les tests de régression et documente les sélecteurs pour des mises à jour rapides. Réduit le coût de maintenance lorsque les sites cibles refont leur mise en page.
Leçon 3 • Surveillance, journalisation et alerte
Implémente la journalisation structurée, les alertes d'erreur et les tableaux de bord d'état de santé des extracteurs. Garantit que les extracteurs de production signalent les défaillances avant qu'elles n'affectent les consommateurs de données en aval.
Leçon 4 • Construction d'extracteurs avec le Framework Scrapy
Présente les spiders, items, pipelines et intergiciels de Scrapy. Fournit un framework de niveau production qui gère la concurrence, les nouvelles tentatives et le stockage automatiquement.
Leçon 5 • Concurrence avec le threading et asyncio
Applique le threading et asyncio pour exécuter plusieurs requêtes en parallèle. Réduit considérablement le temps d'extraction pour les grands ensembles d'URL sans surcharger les serveurs cibles.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste de données : a besoin d'une collecte de données automatisée pour remplacer les exports manuels lents.
Passionné de Python : souhaite construire de vrais projets au-delà des tutoriels et des scripts d'exemple.
Développeur freelance : cherche à proposer des services de données web à des clients payants.
Chercheur : nécessite des ensembles de données frais et structurés qu'aucune source publique ne fournit.
Personne en reconversion professionnelle : vise à accéder à des postes dans le domaine des données avec une compétence technique démontrable.
Professionnel du marketing : cherche à suivre les prix et le contenu des concurrents à grande échelle.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Cameroun ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















