回到辦公室
你仍在一家網頁代理公司擔任資料分析師,現在被指派做網頁爬蟲。你拿到了一份要分析的網址清單,而這份分析你已經在前一章開始著手。
你預期這個任務會重複出現:幾週後很可能還會再被要求做一次。為了讓未來的工作更輕鬆,你決定今天就把程式碼寫得乾淨好維護,之後回頭查看會更容易。
我們先把前一章看過、來自 httr 的兩個函式結合起來:GET() 用來擷取網頁內容,status_code() 用來擷取狀態碼,從而建立一個狀態碼擷取器。
向量 urls 仍可在你的工作環境中使用。我們已經只保留能連線的網址。
本練習屬於課程
使用 purrr 的 R 語言中級函式程式設計
練習說明
載入
purrr與httr。使用
GET()和status_code()組合出一個狀態碼擷取器。在「https://www.thinkr.fr」與「https://en.wikipedia.org」上試用這個新函式。
將這個函式直接對向量
urls進行對映。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)