시작하기무료로 시작하기

또 다른 추출기

이전 연습 문제에서는 H2 헤더에서 텍스트 내용을 추출하는 함수를 만들었어요.

이번에는 다른 작업을 해 보겠습니다. 특정 페이지에 있는 모든 링크를 추출하려고 해요. 이를 위해 두 가지 httr 함수를 호출해야 합니다. 먼저 html_nodes()에서 css 인수를 "a"로 설정하세요(a는 링크를 나타내는 HTML 태그예요). 그리고 html_attr()를 사용해 노드에서 특정 속성을 추출합니다. 여기서는 링크 주소인 "href" 속성을 추출할 거예요.

purrrrvest는 미리 로드해 두었습니다. 작업 공간에는 여전히 urls 벡터가 있어요.

이 연습은 강의의 일부입니다

purrr로 배우는 중급 함수형 프로그래밍

강의 보기

연습 안내

  • css 인수를 "a"로 설정하여 html_nodes()를 미리 채워 두세요.

  • html_attr()를 미리 채운 버전인 href() 함수를 만드세요.

  • href(), get_a(), read_html()를 조합해 새로 합성하세요.

  • 이 새 함수를 urls 벡터에 map 하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create a partial version of html_nodes(), with the css param set to "a"
get_a <- ___(html_nodes, ___)

# Create href(), a partial version of html_attr()
href <- ___(___, name = "href")

# Combine href(), get_a(), and read_html()
get_links <- ___(___, ___, ___)

# Map get_links() to the urls list
res <- ___(urls, ___) %>%
  set_names(urls)

# See the result
res
코드 편집 및 실행