開始使用免費開始

回到辦公室

你仍在一家網頁代理公司擔任資料分析師,現在被指派做網頁爬蟲。你拿到了一份要分析的網址清單,而這份分析你已經在前一章開始著手。

你預期這個任務會重複出現:幾週後很可能還會再被要求做一次。為了讓未來的工作更輕鬆,你決定今天就把程式碼寫得乾淨好維護,之後回頭查看會更容易。

我們先把前一章看過、來自 httr 的兩個函式結合起來:GET() 用來擷取網頁內容,status_code() 用來擷取狀態碼,從而建立一個狀態碼擷取器。

向量 urls 仍可在你的工作環境中使用。我們已經只保留能連線的網址。

本練習屬於課程

使用 purrr 的 R 語言中級函式程式設計

檢視課程

練習說明

  • 載入 purrrhttr

  • 使用 GET()status_code() 組合出一個狀態碼擷取器。

  • 在「https://www.thinkr.fr」與「https://en.wikipedia.org」上試用這個新函式。

  • 將這個函式直接對向量 urls 進行對映。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
編輯並執行程式碼