
Kurz web scrapingu v Pythonu a Scrapy
Naučte se získávat data z jakéhokoli webu pomocí Pythonu a Scrapy – jednoho z nejvýkonnějších dostupných frameworků pro web scraping. Tento kurz Vás provede od nastavení prostředí až po tvorbu produkčně připravených spiderů, které si poradí se stránkováním, ochranou proti botům i stránkami vykreslovanými JavaScriptem. Na jeho konci budete mít portfolio projekt a praktické dovednosti pro automatizaci sběru dat ve velkém měřítku.
Co se naučíte:
Nakonfigurujte si odborné vývojové prostředí pro Python a Scrapy od základu.
Vytvářejte spidery, které automaticky sledují stránkovací odkazy a prolézají celé vícestránkové weby.
Extrahujte, čistěte a ukládejte strukturovaná data do CSV, JSON, SQLite a MongoDB.
Použijte rotaci proxy, podvržení user-agenta a AutoThrottle k obejití běžných obran proti scrapování.
Scrapujte stránky vykreslované JavaScriptem a jednostránkové aplikace pomocí integrace s Playwright.
Navrhujte komplexní scrapovací projekty s opakovaně použitelnými pipelinami, schématy položek a automatizovaným plánováním.
Jak studujete v praxi Kurz web scrapingu v Pythonu a Scrapy
Jak procvičujete Kurz web scrapingu v Pythonu a Scrapy
Pro vás, kteří jste firma a chcete školit svůj tým
V Dedika pro firmy je kurz doplněn o cvičení a příklady přímo z vašeho podnikání a přizpůsoben tak, jak vaše firma potřebuje.
Obsah kurzu
8 Kapitoly • 37 LekceDélka mezi 4 a 360 hodinami (rozhodujete vy)
Kapitola 1SkrýtSkrýt detailyZobrazit detailyNastavení prostředí Python a Scrapy
Nastavení prostředí Python a Scrapy
Lekce 1 • Virtuální prostředí pro projekty v Pythonu
Vytvářejte izolovaná virtuální prostředí, abyste mohli čistě spravovat závislosti projektu. Izolace zabraňuje konfliktům balíčků mezi více projekty.
Lekce 2 • Nastavení editoru kódu pro Scrapy projekty
Nakonfigurujte editor kódu s podporou Pythonu, lintováním a zvýrazňováním syntaxe. Správné nástroje zrychlují vývoj a snižují počet syntaktických chyb.
Lekce 3 • Instalace Scrapy a jeho závislostí
Nainstalujte Scrapy pomocí pip a vyřešte běžné problémy se závislostmi. Čistá instalace potvrzuje, že prostředí je připraveno na vývoj pavouků.
Lekce 4 • Instalace a konfigurace Pythonu
Nainstalujte Python a nakonfigurujte proměnné PATH pro přístup z příkazového řádku. Správné nastavení zde zabrání chybám prostředí v průběhu celého kurzu.
Kapitola 2SkrýtSkrýt detailyZobrazit detailyZáklady webu pro extrakci dat
Základy webu pro extrakci dat
Lekce 1 • Vývojářské nástroje prohlížeče pro průzkum scraperů
K prozkoumání prvků, sledování síťového provozu a kopírování selektorů používejte vývojářské nástroje prohlížeče. Tento průzkumný pracovní postup přímo ovlivňuje návrh spideru.
Lekce 2 • Výrazy XPath pro pokročilý výběr
Pište XPath výrazy pro procházení DOM s větší flexibilitou, než nabízí samotné CSS. XPath zvládá složité vzory procházení, které CSS nedokáže vyjádřit.
Lekce 3 • Jak fungují HTTP požadavky a odpovědi
Sledujte životní cyklus požadavku HTTP od prohlížeče k serveru a zpět. Tento model vysvětluje, co Scrapy replikuje při načítání stránek.
Lekce 4 • CSS selektory pro cílení na data
Použijte syntaxi CSS selektorů k přesnému zacílení konkrétních prvků v HTML dokumentu. Tyto selektory jsou hlavním nástrojem pro cílení ve spiderch Scrapy.
Lekce 5 • Struktura HTML a DOM
Čtení a interpretace HTML dokumentů jako vnořené stromové struktury. Porozumění DOM je nezbytné pro psaní přesných selektorů CSS a XPath.
Kapitola 3SkrýtSkrýt detailyZobrazit detailyTvorba vašeho prvního Scrapy spideru
Tvorba vašeho prvního Scrapy spideru
Lekce 1 • Spouštění a ladění spiderů
Spouštějte spiders příkazem scrapy crawl a interpretujte výstup logů. Dovednosti ladění zkracují čas strávený na rozbitých spiderch.
Lekce 2 • Anatomie třídy Scrapy Spider
Prozkoumejte základní třídu Spider a její požadované atributy a metody. Každý spider tuto strukturu dědí, proto je její zvládnutí základem.
Lekce 3 • Extrakce dat pomocí selektorů
Použijte CSS a XPath selektory uvnitř metody parse k extrakci textu a atributů. Přesná extrakce je základní dovedností každého spideru.
Lekce 4 • Vysvětlení struktury projektu Scrapy
Vygenerujte projekt Scrapy a porozumějte úloze každého vygenerovaného souboru. Znalost struktury zabraňuje chybně umístěnému kódu a chybám v konfiguraci.
Kapitola 4SkrýtSkrýt detailyZobrazit detailyPoložky Scrapy a datové modelování
Položky Scrapy a datové modelování
Lekce 1 • Čištění dat pomocí procesorů
Napište vlastní funkce procesoru pro odstranění přebytečných znaků, přetypování a normalizaci hodnot polí. Vyčištění dat na úrovni zavaděče snižuje složitost navazujícího pipeline.
Lekce 2 • Definování položek ve Scrapy
Deklarujte třídy Item s typovanými poli pro reprezentaci scrapovaných záznamů. Třídy Item vynucují konzistentní schéma napříč všemi pavouky v projektu.
Lekce 3 • Použití nástroje ItemLoaders pro čistá data
Použijte ItemLoadery k automatizaci zpracování vstupních a výstupních hodnot polí. Loadery oddělují extrakční logiku od čisticí logiky pro lepší udržovatelnost.
Lekce 4 • Ověřování vytěžených dat
Přidejte ověření na úrovni polí, abyste zachytili poškozené záznamy ještě před jejich uložením. Včasné ověření zabraňuje vstupu poškozených dat do datových pipeline.
Kapitola 5SkrýtSkrýt detailyZobrazit detailyProcházení více stránek a webů
Procházení více stránek a webů
Lekce 1 • Následování odkazů pomocí Scrapy Requests
Z metod parse vracejte objekty scrapy.Request, abyste crawleru dali pokyn k načtení dalších URL. Sledování odkazů je mechanismus, který stojí za procházením celých webů.
Lekce 2 • Použití CrawlSpideru pro procházení na základě pravidel
Využijte podtřídu CrawlSpider a objekty Rule k deklarativnímu definování vzorců pro sledování odkazů. Pravidla snižují množství opakujícího se kódu u rozsáhlých strukturovaných webů.
Lekce 3 • Správa hloubky a rozsahu procházení
Nakonfigurujte hloubkové limity a filtry URL adres, abyste udrželi procházení cílené a efektivní. Řízení rozsahu zabraňuje nekontrolovanému procházení, které plýtvá zdroji.
Lekce 4 • Strategie stránkování
Rozpoznávejte a sledujte odkazy na další stránky napříč číslovanými stránkovacími schématy a schématy založenými na kurzoru. Zpracování stránkování umožňuje úplnou extrakci datových sad.
Lekce 5 • Předávání dat mezi požadavky
Použijte slovníky cb_kwargs a meta k přenášení kontextu z jednoho požadavku na druhý. Sdílený kontext umožňuje sestavování vícestránkových záznamů.
Kapitola 6SkrýtSkrýt detailyZobrazit detailyScrapy pipelines a ukládání dat
Scrapy pipelines a ukládání dat
Lekce 1 • Export dat do CSV a JSON
Používejte vestavěné exportéry feedů v Scrapy k zápisu položek do plochých souborů. Exporty do plochých souborů představují nejrychlejší cestu od spideru k použitelným datům.
Lekce 2 • Psaní vlastních komponent pipeline
Vytvářejte třídy pipeline, které čistí, deduplikují nebo obohacují položky před uložením. Vlastní pipeline zpracovávají logiku, kterou exportéry nedokážou vyjádřit.
Lekce 3 • Ukládání dat v MongoDB
Napište pipeline, který vkládá položky do kolekce MongoDB pomocí PyMonga. Dokumentové úložiště se hodí pro scrapovaná data s proměnlivými nebo zanořenými poli.
Lekce 4 • Ukládání dat v SQL databázi
Připojte pipeline k relační databázi a vkládejte položky řádek po řádku. Databázové úložiště umožňuje dotazování a dlouhodobou správu dat.
Lekce 5 • Porozumění pipeline architektuře
Sledujte, jak položky procházejí od spiderů přes seřazené komponenty pipeline. Porozumění tomuto toku je nezbytné pro návrh účinných zpracovatelských řetězců.
Kapitola 7SkrýtSkrýt detailyZobrazit detailyŘešení opatření proti scrapování
Řešení opatření proti scrapování
Lekce 1 • Porozumění technikám detekce botů
Katalogizujte signály na straně serveru používané k identifikaci automatizovaného provozu. Znalost metod detekce napomáhá protiopatřením uplatňovaným v pozdějších částech.
Lekce 2 • Omezování počtu požadavků pomocí AutoThrottle
Povolte rozšíření AutoThrottle ve Scrapy, aby se rychlost požadavků přizpůsobila době odezvy serveru. Zdvořilé procházení snižuje riziko zákazů kvůli omezení rychlosti.
Lekce 3 • Rotace uživatelských agentů a hlaviček
Nakonfigurujte middleware tak, aby při každém požadavku náhodně měnil řetězce user-agent a HTTP hlavičky. Rotace hlaviček snižuje otisk, který spouští detekci botů.
Lekce 4 • Používání rotace proxy serverů
Směrujte požadavky přes rotující proxy fondy, abyste rozložili provoz mezi více IP adres. Rotace proxy je hlavní obranou proti zákazům založeným na IP adrese.
Lekce 5 • Správa cookies a relací
Ovládejte práci s cookies pro udržování relací nebo izolaci požadavků podle potřeby. Správná správa relací zabraňuje blokování přihlašovacími stěnami a detekci na základě relací.
Kapitola 8SkrýtSkrýt detailyZobrazit detailyScrapování stránek vykreslovaných JavaScriptem
Scrapování stránek vykreslovaných JavaScriptem
Lekce 1 • Zpracování nekonečného posouvání a líného načítání
Automatizujte akce posouvání a spouštějte události líného načítání, abyste odhalili skrytý obsah. Tyto techniky dokončí extrakci dat na moderních stránkách se stylem feedu.
Lekce 2 • Identifikace obsahu vykreslovaného JavaScriptem
Před volbou strategie scrapování rozlišujte mezi HTML vykresleným na serveru a obsahem vykresleným na straně klienta. Správná identifikace zabrání zbytečné práci při použití nesprávného přístupu.
Lekce 3 • Kompromisy ve výkonnosti automatizace prohlížeče
Porovnejte rychlost, náročnost na zdroje a spolehlivost bezhlavých prohlížečů oproti přímým HTTP požadavkům. Informovaná rozhodnutí o kompromisech udržují projekty udržovatelné a efektivní.
Lekce 4 • Integrace Scrapy s Playwrightem
Použijte knihovnu scrapy-playwright k vykreslení JavaScriptu v rámci request pipeline nástroje Scrapy. Integrace Playwright zvládá weby, kde není odchytávání API možné.
Lekce 5 • Přímé zachytávání volání API
Reverzním inženýrstvím zjistěte podkladové požadavky API, které prohlížeč vytváří, a volejte je přímo pomocí Scrapy. Přímá volání API jsou rychlejší a stabilnější než automatizace prohlížeče.
Váš platný certifikát o dokončení
Tento kurz je pro vás:
Aspirující datoví analytici: potřebují reálné datové sady bez spoléhání na poskytovatele třetích stran.
Python hobbyisté: jsou připraveni překročit rámec tutoriálů a vytvořit něco skutečně užitečného.
Vývojáři na volné noze: chtějí nabízet automatizovaný sběr dat jako zpoplatněnou službu.
Lidé měnící kariéru: míří na datové nebo backendové pozice a potřebují konkrétní portfolio projekt.
Výzkumníci a akademici: potřebují opakovaně shromažďovat webová data bez ručního kopírování a vkládání.
Majitelé malých firem: chtějí automaticky sledovat konkurenty nebo shromažďovat informace o trhu.
Co říkají naši studenti
Vaše lekce jsou perfektní. Koupil jsem si roční balíček a konečně mám možnost sledovat různá témata, která mě zajímají, aniž bych musel měnit platformu... děkuji za vše, co děláte, už jsem vás doporučil dalším lidem...

Líbí se mi, jak jsou lekce přímočaré a jak mohu přepínat mezi kapitolami a přeskakovat obsah, který nepotřebuji.

Líbí se mi obsah a způsob prezentace a přepisu videí, což celý proces zrychluje!

Platforma je rychlá a jednoduchá na používání. Rozmanitost obsahu a doplňková videa velmi pomáhají při učení.

Hlavní školení
Často kladené otázky
Kdo je Dedika?
Je certifikát platný v Česko?
Jsou kurzy zdarma?
Jaká je pracovní zátěž kurzu?
Jak kurzy vypadají?
Jak kurzy fungují?
Jaká je délka kurzů?
Jaká je cena nebo poplatek za kurzy?
Co je EAD nebo online kurz a jak funguje?
PDF kurz




















