ПочатиПочніть безкоштовно

Псевдоніми

У цій вправі ми підготували клас павука, який після завершення забиратиме імена авторів зі скороченої версії каталогу курсів DataCamp. URL цієї скороченої версії збережено у змінній url_short. Ваше завдання — створити список витягнутих імен авторів у методі parse павука.

Дві речі, які варто знати:

  • Тут ви використовуватимете об'єкт response і метод css.
  • Імена авторів курсів задані текстом усередині елементів абзацу p, що належать до класу course-block__author-name.

Ви можете перевірити павука за допомогою функції inspect_spider(), яку ми для вас підготували — вона надрукує імена авторів, які ви знайдете!

Зверніть увагу, що це та наступні вправи в цьому розділі можуть завантажуватися певний час.

Ця вправа є частиною курсу

Вебскрапінг у Python

Переглянути курс

Інструкції до вправи

  • Заповніть необхідні аргументи методу parse, щоб він працював як слід, коли його буде викликано в методі start_requests.
  • У межах методу parse створіть змінну author_names — список рядків, утворених витягненням тексту з елементів абзацу класу course-block__author-name.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
Редагувати та запускати код