시작하기무료로 시작하기

콘텐츠 추출기

이전 연습에서는 제공된 URLs 벡터의 모든 요소가 200 상태 코드를 반환한다는 것을 확인했어요. 이제 접근 가능한 것을 알았으니, 웹 스크레이핑을 한 단계 더 진행해 실제 콘텐츠를 추출해 보겠습니다.

이를 위해 rvest 패키지의 함수를 사용하고, partial()로 인자를 미리 채워 둘 거예요. 이번 연습에서 작성할 함수는 페이지에서 모든 H2 HTML 노드를 추출합니다 — 웹페이지에서 H2 노드는 2단계 제목을 의미하죠. 제목 노드를 추출한 뒤에는 html_text() 함수를 사용해 원시 HTML에서 텍스트만 뽑아낼 거예요.

purrrrvest는 이미 로드되어 있으며, 작업 공간에는 urls 벡터가 준비되어 있어요.

이 연습은 강의의 일부입니다

purrr로 배우는 중급 함수형 프로그래밍

강의 보기

연습 안내

  • 먼저 html_nodes()css = "h2"를 미리 채워 넣으세요.

  • 이렇게 만든 함수를 read_htmlhtml_text 사이에 결합해, H2 헤더의 텍스트를 추출하는 함수를 만드세요.

  • 만든 함수를 urls 벡터에 실행하고, 결과에 이름을 지정하세요.

  • 결과를 출력해 형태를 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
코드 편집 및 실행