시작하기무료로 시작하기

필명

이 연습 문제에서는, 완성되면 DataCamp 강의 디렉터리의 축약 버전에서 작성자 이름을 가져오는 스파이더 클래스를 준비해 두었습니다. 축약 버전의 URL은 변수 url_short에 저장되어 있어요. 여러분의 과제는 스파이더의 parse 메서드에서 추출된 작성자 이름 목록을 만드는 것입니다.

두 가지를 알아두세요:

  • 여기서는 response 객체와 css 메서드를 사용합니다.
  • 강의 작성자 이름은 클래스 course-block__author-name에 속한 문단 p 요소 안의 텍스트로 정의됩니다.

저희가 만들어 둔 inspect_spider() 함수를 사용해 스파이더를 검사할 수 있어요. 여러분이 찾아낸 작성자 이름을 출력해 줍니다!

참고: 이 장의 이번 문제와 이후 문제들은 로딩에 다소 시간이 걸릴 수 있습니다.

이 연습은 강의의 일부입니다

Python으로 하는 웹 스크레이핑

강의 보기

연습 안내

  • start_requests 메서드에서 호출될 때 요구사항에 맞게 동작하도록 parse 메서드에 필요한 인자를 채워 넣으세요.
  • parse 메서드 안에서, 클래스 course-block__author-name에 속한 문단 요소에서 텍스트를 추출해 만든 문자열 리스트 변수 author_names생성하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
코드 편집 및 실행