Jména autorů
V tomto cvičení máš připravenou třídu spideru, která po dokončení načte jména autorů ze zkrácené verze katalogu kurzů DataCamp. URL zkrácené verze je uložena v proměnné url_short. Tvým úkolem je vytvořit seznam extrahovaných jmen autorů v metodě parse tohoto spideru.
Dvě věci, které by ses měl/a mít na paměti:
- Budeš používat objekt
responsea metoducss. - Jména autorů kurzů jsou definována textem uvnitř elementů
ppatřících do třídycourse-block__author-name
Spider si můžeš prohlédnout pomocí funkce inspect_spider(), kterou jsme pro tebe připravili – vypíše nalezená jména autorů!
Toto a zbývající cvičení v této kapitole mohou chvíli trvat, než se načtou.
Toto cvičení je součástí kurzu
Web Scraping v Pythonu
Pokyny k cvičení
- Doplň požadované argumenty metody
parsetak, aby správně fungovala při volání v metoděstart_requests. - V metodě
parsevytvoř proměnnouauthor_namesjako seznam řetězců, který vznikne extrakcí textu z elementůppatřících do třídycourse-block__author-name.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )