or
Toto cvičení je součástí kurzu
Seznám se se strukturou HTML. Začneme tím, proč může být web scraping cenným nástrojem v tvé sadě dovedností datového vědce, a pak se ponoříme do základů HTML. Kapitolu zakončíme stručným úvodem do zápisu XPath, který slouží k navigaci mezi prvky v HTML kódu.
Využij syntaxi XPath k prozkoumávání selektorů ve scrapy. Obě tato témata tě přiblíží k tomu, abys uměl/a scrapovat HTML dokumenty.
Nauč se syntaxi CSS lokátorů a začni pracovat s myšlenkou řetězení CSS lokátorů s XPath. Představíme také objekty Response, které se chovají podobně jako selektory, ale nabízejí navíc nástroje pro rozšíření scrapingu na více webových stránek.
Aktuální cvičení
Nauč se vytvářet webové crawlery pomocí scrapy. Tito scrapy pavouci budou procházet web přes více stránek, sledovat odkazy a automaticky scrapovat jejich obsah podle postupů, které jsme probírali v předchozích kapitolách.