Псевдоніми
У цій вправі ми підготували клас павука, який після завершення забиратиме імена авторів зі скороченої версії каталогу курсів DataCamp. URL цієї скороченої версії збережено у змінній url_short. Ваше завдання — створити список витягнутих імен авторів у методі parse павука.
Дві речі, які варто знати:
- Тут ви використовуватимете об'єкт
responseі методcss. - Імена авторів курсів задані текстом усередині елементів абзацу
p, що належать до класуcourse-block__author-name.
Ви можете перевірити павука за допомогою функції inspect_spider(), яку ми для вас підготували — вона надрукує імена авторів, які ви знайдете!
Зверніть увагу, що це та наступні вправи в цьому розділі можуть завантажуватися певний час.
Ця вправа є частиною курсу
Вебскрапінг у Python
Інструкції до вправи
- Заповніть необхідні аргументи методу parse, щоб він працював як слід, коли його буде викликано в методі
start_requests. - У межах методу
parseстворіть зміннуauthor_names— список рядків, утворених витягненням тексту з елементів абзацу класуcourse-block__author-name.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )