시작하기무료로 시작하기

httr 방식으로 해보기

최근 휴가를 보낸 아름다운 장소의 고도를 알아보려고 사용했던 rvest 코드가 있습니다.

# 위키피디아에서 HTML 문서 가져오기
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# 문서를 파싱하고 그 안에서 고도 정보 추출하기
wikipedia_page %>% 
  html_elements('table tr:nth-child(9) > td') %>% 
  html_text()

영상에서 배우셨듯이, 이 예시처럼 URL을 넣으면 read_html()은 실제로 HTTP GET 요청을 보냅니다.

이번 연습 문제의 목표는 read_html() 없이, 대신 httr 메서드만으로 동일한 요청을 재현하는 것입니다.

참고: 보통은 rvest만으로 충분하지만, 이 장 후반에서 보실 것처럼 요청을 커스터마이즈하려면 httr 방식을 알아두셔야 합니다.

복습을 겸해, html_elements()에서 사용한 CSS 선택자를 XPATH 쿼리로도 바꿔 보겠습니다.

이 연습은 강의의 일부입니다

R로 배우는 웹 스크레이핑

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)
코드 편집 및 실행