Zacznij terazZacznij za darmo

Pseudonimy

W tym ćwiczeniu masz do dyspozycji klasę pająka, która – po uzupełnieniu – pobierze imiona i nazwiska autorów ze skróconej wersji katalogu kursów DataCamp. URL tej skróconej wersji jest przechowywany w zmiennej url_short. Twoim zadaniem jest utworzenie listy wyodrębnionych imion i nazwisk autorów w metodzie parse pająka.

Dwie ważne informacje:

  • Będziesz korzystać z obiektu response i metody css.
  • Imiona i nazwiska autorów kursów są zdefiniowane przez tekst zawarty w elementach akapitu p należących do klasy course-block__author-name

Możesz sprawdzić działanie pająka za pomocą funkcji inspect_spider(), którą dla ciebie przygotowaliśmy – wyświetli ona znalezione imiona i nazwiska autorów!

Pamiętaj, że to i pozostałe ćwiczenia w tym rozdziale mogą wymagać chwili na załadowanie.

To ćwiczenie jest częścią kursu

Web Scraping w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Uzupełnij wymagane argumenty metody parse, tak aby działała poprawnie po wywołaniu w metodzie start_requests.
  • Wewnątrz metody parse utwórz zmienną author_names – listę ciągów znaków powstałą przez wyodrębnienie tekstu z elementów akapitu należących do klasy course-block__author-name.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
Edytuj i uruchom kod