Pseudonimy
W tym ćwiczeniu masz do dyspozycji klasę pająka, która – po uzupełnieniu – pobierze imiona i nazwiska autorów ze skróconej wersji katalogu kursów DataCamp. URL tej skróconej wersji jest przechowywany w zmiennej url_short. Twoim zadaniem jest utworzenie listy wyodrębnionych imion i nazwisk autorów w metodzie parse pająka.
Dwie ważne informacje:
- Będziesz korzystać z obiektu
responsei metodycss. - Imiona i nazwiska autorów kursów są zdefiniowane przez tekst zawarty w elementach akapitu
pnależących do klasycourse-block__author-name
Możesz sprawdzić działanie pająka za pomocą funkcji inspect_spider(), którą dla ciebie przygotowaliśmy – wyświetli ona znalezione imiona i nazwiska autorów!
Pamiętaj, że to i pozostałe ćwiczenia w tym rozdziale mogą wymagać chwili na załadowanie.
To ćwiczenie jest częścią kursu
Web Scraping w Pythonie
Instrukcje do ćwiczenia
- Uzupełnij wymagane argumenty metody
parse, tak aby działała poprawnie po wywołaniu w metodziestart_requests. - Wewnątrz metody
parseutwórz zmiennąauthor_names– listę ciągów znaków powstałą przez wyodrębnienie tekstu z elementów akapitu należących do klasycourse-block__author-name.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )