Vyberte svůj jazyk
Kurz web scrapingu v Pythonu a Scrapy
Více než 2 miliony studentů po celém světě

Kurz web scrapingu v Pythonu a Scrapy

Naučte se získávat data z jakéhokoli webu pomocí Pythonu a Scrapy – jednoho z nejvýkonnějších dostupných frameworků pro web scraping. Tento kurz Vás provede od nastavení prostředí až po tvorbu produkčně připravených spiderů, které si poradí se stránkováním, ochranou proti botům i stránkami vykreslovanými JavaScriptem. Na jeho konci budete mít portfolio projekt a praktické dovednosti pro automatizaci sběru dat ve velkém měřítku.

Dedika pro firmy

Co se naučíte:

  • Nakonfigurujte si odborné vývojové prostředí pro Python a Scrapy od základu.

  • Vytvářejte spidery, které automaticky sledují stránkovací odkazy a prolézají celé vícestránkové weby.

  • Extrahujte, čistěte a ukládejte strukturovaná data do CSV, JSON, SQLite a MongoDB.

  • Použijte rotaci proxy, podvržení user-agenta a AutoThrottle k obejití běžných obran proti scrapování.

  • Scrapujte stránky vykreslované JavaScriptem a jednostránkové aplikace pomocí integrace s Playwright.

  • Navrhujte komplexní scrapovací projekty s opakovaně použitelnými pipelinami, schématy položek a automatizovaným plánováním.

Jak studujete v praxi Kurz web scrapingu v Pythonu a Scrapy

Jak procvičujete Kurz web scrapingu v Pythonu a Scrapy

Pro vás, kteří jste firma a chcete školit svůj tým

V Dedika pro firmy je kurz doplněn o cvičení a příklady přímo z vašeho podnikání a přizpůsoben tak, jak vaše firma potřebuje.

Klikněte zde

Obsah kurzu

8 Kapitoly • 37 LekceDélka mezi 4 a 360 hodinami (rozhodujete vy)

Kapitola 1Zobrazit detaily

Nastavení prostředí Python a Scrapy

  • Lekce 1 • Virtuální prostředí pro projekty v Pythonu

    Vytvářejte izolovaná virtuální prostředí, abyste mohli čistě spravovat závislosti projektu. Izolace zabraňuje konfliktům balíčků mezi více projekty.

  • Lekce 2 • Nastavení editoru kódu pro Scrapy projekty

    Nakonfigurujte editor kódu s podporou Pythonu, lintováním a zvýrazňováním syntaxe. Správné nástroje zrychlují vývoj a snižují počet syntaktických chyb.

  • Lekce 3 • Instalace Scrapy a jeho závislostí

    Nainstalujte Scrapy pomocí pip a vyřešte běžné problémy se závislostmi. Čistá instalace potvrzuje, že prostředí je připraveno na vývoj pavouků.

  • Lekce 4 • Instalace a konfigurace Pythonu

    Nainstalujte Python a nakonfigurujte proměnné PATH pro přístup z příkazového řádku. Správné nastavení zde zabrání chybám prostředí v průběhu celého kurzu.

Kapitola 2Zobrazit detaily

Základy webu pro extrakci dat

  • Lekce 1 • Vývojářské nástroje prohlížeče pro průzkum scraperů

    K prozkoumání prvků, sledování síťového provozu a kopírování selektorů používejte vývojářské nástroje prohlížeče. Tento průzkumný pracovní postup přímo ovlivňuje návrh spideru.

  • Lekce 2 • Výrazy XPath pro pokročilý výběr

    Pište XPath výrazy pro procházení DOM s větší flexibilitou, než nabízí samotné CSS. XPath zvládá složité vzory procházení, které CSS nedokáže vyjádřit.

  • Lekce 3 • Jak fungují HTTP požadavky a odpovědi

    Sledujte životní cyklus požadavku HTTP od prohlížeče k serveru a zpět. Tento model vysvětluje, co Scrapy replikuje při načítání stránek.

  • Lekce 4 • CSS selektory pro cílení na data

    Použijte syntaxi CSS selektorů k přesnému zacílení konkrétních prvků v HTML dokumentu. Tyto selektory jsou hlavním nástrojem pro cílení ve spiderch Scrapy.

  • Lekce 5 • Struktura HTML a DOM

    Čtení a interpretace HTML dokumentů jako vnořené stromové struktury. Porozumění DOM je nezbytné pro psaní přesných selektorů CSS a XPath.

Kapitola 3Zobrazit detaily

Tvorba vašeho prvního Scrapy spideru

  • Lekce 1 • Spouštění a ladění spiderů

    Spouštějte spiders příkazem scrapy crawl a interpretujte výstup logů. Dovednosti ladění zkracují čas strávený na rozbitých spiderch.

  • Lekce 2 • Anatomie třídy Scrapy Spider

    Prozkoumejte základní třídu Spider a její požadované atributy a metody. Každý spider tuto strukturu dědí, proto je její zvládnutí základem.

  • Lekce 3 • Extrakce dat pomocí selektorů

    Použijte CSS a XPath selektory uvnitř metody parse k extrakci textu a atributů. Přesná extrakce je základní dovedností každého spideru.

  • Lekce 4 • Vysvětlení struktury projektu Scrapy

    Vygenerujte projekt Scrapy a porozumějte úloze každého vygenerovaného souboru. Znalost struktury zabraňuje chybně umístěnému kódu a chybám v konfiguraci.

Kapitola 4Zobrazit detaily

Položky Scrapy a datové modelování

  • Lekce 1 • Čištění dat pomocí procesorů

    Napište vlastní funkce procesoru pro odstranění přebytečných znaků, přetypování a normalizaci hodnot polí. Vyčištění dat na úrovni zavaděče snižuje složitost navazujícího pipeline.

  • Lekce 2 • Definování položek ve Scrapy

    Deklarujte třídy Item s typovanými poli pro reprezentaci scrapovaných záznamů. Třídy Item vynucují konzistentní schéma napříč všemi pavouky v projektu.

  • Lekce 3 • Použití nástroje ItemLoaders pro čistá data

    Použijte ItemLoadery k automatizaci zpracování vstupních a výstupních hodnot polí. Loadery oddělují extrakční logiku od čisticí logiky pro lepší udržovatelnost.

  • Lekce 4 • Ověřování vytěžených dat

    Přidejte ověření na úrovni polí, abyste zachytili poškozené záznamy ještě před jejich uložením. Včasné ověření zabraňuje vstupu poškozených dat do datových pipeline.

Kapitola 5Zobrazit detaily

Procházení více stránek a webů

  • Lekce 1 • Následování odkazů pomocí Scrapy Requests

    Z metod parse vracejte objekty scrapy.Request, abyste crawleru dali pokyn k načtení dalších URL. Sledování odkazů je mechanismus, který stojí za procházením celých webů.

  • Lekce 2 • Použití CrawlSpideru pro procházení na základě pravidel

    Využijte podtřídu CrawlSpider a objekty Rule k deklarativnímu definování vzorců pro sledování odkazů. Pravidla snižují množství opakujícího se kódu u rozsáhlých strukturovaných webů.

  • Lekce 3 • Správa hloubky a rozsahu procházení

    Nakonfigurujte hloubkové limity a filtry URL adres, abyste udrželi procházení cílené a efektivní. Řízení rozsahu zabraňuje nekontrolovanému procházení, které plýtvá zdroji.

  • Lekce 4 • Strategie stránkování

    Rozpoznávejte a sledujte odkazy na další stránky napříč číslovanými stránkovacími schématy a schématy založenými na kurzoru. Zpracování stránkování umožňuje úplnou extrakci datových sad.

  • Lekce 5 • Předávání dat mezi požadavky

    Použijte slovníky cb_kwargs a meta k přenášení kontextu z jednoho požadavku na druhý. Sdílený kontext umožňuje sestavování vícestránkových záznamů.

Kapitola 6Zobrazit detaily

Scrapy pipelines a ukládání dat

  • Lekce 1 • Export dat do CSV a JSON

    Používejte vestavěné exportéry feedů v Scrapy k zápisu položek do plochých souborů. Exporty do plochých souborů představují nejrychlejší cestu od spideru k použitelným datům.

  • Lekce 2 • Psaní vlastních komponent pipeline

    Vytvářejte třídy pipeline, které čistí, deduplikují nebo obohacují položky před uložením. Vlastní pipeline zpracovávají logiku, kterou exportéry nedokážou vyjádřit.

  • Lekce 3 • Ukládání dat v MongoDB

    Napište pipeline, který vkládá položky do kolekce MongoDB pomocí PyMonga. Dokumentové úložiště se hodí pro scrapovaná data s proměnlivými nebo zanořenými poli.

  • Lekce 4 • Ukládání dat v SQL databázi

    Připojte pipeline k relační databázi a vkládejte položky řádek po řádku. Databázové úložiště umožňuje dotazování a dlouhodobou správu dat.

  • Lekce 5 • Porozumění pipeline architektuře

    Sledujte, jak položky procházejí od spiderů přes seřazené komponenty pipeline. Porozumění tomuto toku je nezbytné pro návrh účinných zpracovatelských řetězců.

Kapitola 7Zobrazit detaily

Řešení opatření proti scrapování

  • Lekce 1 • Porozumění technikám detekce botů

    Katalogizujte signály na straně serveru používané k identifikaci automatizovaného provozu. Znalost metod detekce napomáhá protiopatřením uplatňovaným v pozdějších částech.

  • Lekce 2 • Omezování počtu požadavků pomocí AutoThrottle

    Povolte rozšíření AutoThrottle ve Scrapy, aby se rychlost požadavků přizpůsobila době odezvy serveru. Zdvořilé procházení snižuje riziko zákazů kvůli omezení rychlosti.

  • Lekce 3 • Rotace uživatelských agentů a hlaviček

    Nakonfigurujte middleware tak, aby při každém požadavku náhodně měnil řetězce user-agent a HTTP hlavičky. Rotace hlaviček snižuje otisk, který spouští detekci botů.

  • Lekce 4 • Používání rotace proxy serverů

    Směrujte požadavky přes rotující proxy fondy, abyste rozložili provoz mezi více IP adres. Rotace proxy je hlavní obranou proti zákazům založeným na IP adrese.

  • Lekce 5 • Správa cookies a relací

    Ovládejte práci s cookies pro udržování relací nebo izolaci požadavků podle potřeby. Správná správa relací zabraňuje blokování přihlašovacími stěnami a detekci na základě relací.

Kapitola 8Zobrazit detaily

Scrapování stránek vykreslovaných JavaScriptem

  • Lekce 1 • Zpracování nekonečného posouvání a líného načítání

    Automatizujte akce posouvání a spouštějte události líného načítání, abyste odhalili skrytý obsah. Tyto techniky dokončí extrakci dat na moderních stránkách se stylem feedu.

  • Lekce 2 • Identifikace obsahu vykreslovaného JavaScriptem

    Před volbou strategie scrapování rozlišujte mezi HTML vykresleným na serveru a obsahem vykresleným na straně klienta. Správná identifikace zabrání zbytečné práci při použití nesprávného přístupu.

  • Lekce 3 • Kompromisy ve výkonnosti automatizace prohlížeče

    Porovnejte rychlost, náročnost na zdroje a spolehlivost bezhlavých prohlížečů oproti přímým HTTP požadavkům. Informovaná rozhodnutí o kompromisech udržují projekty udržovatelné a efektivní.

  • Lekce 4 • Integrace Scrapy s Playwrightem

    Použijte knihovnu scrapy-playwright k vykreslení JavaScriptu v rámci request pipeline nástroje Scrapy. Integrace Playwright zvládá weby, kde není odchytávání API možné.

  • Lekce 5 • Přímé zachytávání volání API

    Reverzním inženýrstvím zjistěte podkladové požadavky API, které prohlížeč vytváří, a volejte je přímo pomocí Scrapy. Přímá volání API jsou rychlejší a stabilnější než automatizace prohlížeče.

Certifikace

Váš platný certifikát o dokončení

Tento kurz je pro vás:

  • Aspirující datoví analytici: potřebují reálné datové sady bez spoléhání na poskytovatele třetích stran.

  • Python hobbyisté: jsou připraveni překročit rámec tutoriálů a vytvořit něco skutečně užitečného.

  • Vývojáři na volné noze: chtějí nabízet automatizovaný sběr dat jako zpoplatněnou službu.

  • Lidé měnící kariéru: míří na datové nebo backendové pozice a potřebují konkrétní portfolio projekt.

  • Výzkumníci a akademici: potřebují opakovaně shromažďovat webová data bez ručního kopírování a vkládání.

  • Majitelé malých firem: chtějí automaticky sledovat konkurenty nebo shromažďovat informace o trhu.

Co říkají naši studenti

Vaše lekce jsou perfektní. Koupil jsem si roční balíček a konečně mám možnost sledovat různá témata, která mě zajímají, aniž bych musel měnit platformu... děkuji za vše, co děláte, už jsem vás doporučil dalším lidem...
Giulio Carlo
Giulio CarloStudent digitálního marketingu
Líbí se mi, jak jsou lekce přímočaré a jak mohu přepínat mezi kapitolami a přeskakovat obsah, který nepotřebuji.
Mariana Ferres
Mariana FerresStudentka fotografie
Líbí se mi obsah a způsob prezentace a přepisu videí, což celý proces zrychluje!
Luciana Alvarenga
Luciana AlvarengaStudentka nail designu
Platforma je rychlá a jednoduchá na používání. Rozmanitost obsahu a doplňková videa velmi pomáhají při učení.
André Felipe
André FelipeStudent prompt engineeringu

Hlavní školení

Často kladené otázky

Kdo je Dedika?

Je certifikát platný v Česko?

Jsou kurzy zdarma?

Jaká je pracovní zátěž kurzu?

Jak kurzy vypadají?

Jak kurzy fungují?

Jaká je délka kurzů?

Jaká je cena nebo poplatek za kurzy?

Co je EAD nebo online kurz a jak funguje?

PDF kurz