開始使用免費開始

用 httr 的方式來做

以下是一些我用來查詢我最近度假地點海拔的 rvest 程式碼。

# 從 Wikipedia 取得 HTML 文件
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# 解析文件並從中擷取海拔資訊
wikipedia_page %>% 
  html_elements('table tr:nth-child(9) > td') %>% 
  html_text()

正如你在影片中學到的,當 read_html() 接收到 URL(就像這個例子)時,實際上會發出一個 HTTP GET 請求。

本練習的目標是不用 read_html(),而是改用 httr 的方法來重現相同的查詢。

注意:一般情況下用 rvest 就足夠了,但如果你想客製化請求(本章後面會示範),就需要知道如何用 httr 來做。

另外複習一下,你也會把 html_elements() 中使用的 CSS 選擇器轉寫成 XPATH 查詢。

本練習屬於課程

R 的網頁爬蟲

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)
編輯並執行程式碼