Začněte nyníZačněte zdarma

Jména autorů

V tomto cvičení máš připravenou třídu spideru, která po dokončení načte jména autorů ze zkrácené verze katalogu kurzů DataCamp. URL zkrácené verze je uložena v proměnné url_short. Tvým úkolem je vytvořit seznam extrahovaných jmen autorů v metodě parse tohoto spideru.

Dvě věci, které by ses měl/a mít na paměti:

  • Budeš používat objekt response a metodu css.
  • Jména autorů kurzů jsou definována textem uvnitř elementů p patřících do třídy course-block__author-name

Spider si můžeš prohlédnout pomocí funkce inspect_spider(), kterou jsme pro tebe připravili – vypíše nalezená jména autorů!

Toto a zbývající cvičení v této kapitole mohou chvíli trvat, než se načtou.

Toto cvičení je součástí kurzu

Web Scraping v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Doplň požadované argumenty metody parse tak, aby správně fungovala při volání v metodě start_requests.
  • V metodě parse vytvoř proměnnou author_names jako seznam řetězců, který vznikne extrakcí textu z elementů p patřících do třídy course-block__author-name.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
Upravit a spustit kód