필명
이 연습 문제에서는, 완성되면 DataCamp 강의 디렉터리의 축약 버전에서 작성자 이름을 가져오는 스파이더 클래스를 준비해 두었습니다. 축약 버전의 URL은 변수 url_short에 저장되어 있어요. 여러분의 과제는 스파이더의 parse 메서드에서 추출된 작성자 이름 목록을 만드는 것입니다.
두 가지를 알아두세요:
- 여기서는
response객체와css메서드를 사용합니다. - 강의 작성자 이름은 클래스
course-block__author-name에 속한 문단p요소 안의 텍스트로 정의됩니다.
저희가 만들어 둔 inspect_spider() 함수를 사용해 스파이더를 검사할 수 있어요. 여러분이 찾아낸 작성자 이름을 출력해 줍니다!
참고: 이 장의 이번 문제와 이후 문제들은 로딩에 다소 시간이 걸릴 수 있습니다.
이 연습은 강의의 일부입니다
Python으로 하는 웹 스크레이핑
연습 안내
start_requests메서드에서 호출될 때 요구사항에 맞게 동작하도록parse메서드에 필요한 인자를 채워 넣으세요.parse메서드 안에서, 클래스course-block__author-name에 속한 문단 요소에서 텍스트를 추출해 만든 문자열 리스트 변수author_names를 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )