Înapoi la birou
Lucrezi în continuare ca analist de date pentru o agenție web și ți s-a cerut să faci web scraping. Ai primit o listă de URL-uri de analizat – o analiză pe care ai început-o deja în capitolul anterior.
Te aștepți ca această sarcină să fie recurentă: cu siguranță vei fi rugat să o repeți peste câteva săptămâni. Pentru a-ți ușura munca viitoare, ai decis să scrii cod curat astăzi, astfel încât să fie mai simplu să revii la el mai târziu.
Vom începe prin a combina cele două funcții din httr pe care le-am văzut în capitolul anterior: GET(), pentru a prelua pagina web, și status_code(), pentru a extrage codul de stare – în scopul de a crea un extractor de cod de stare.
Vectorul urls este disponibil în continuare în spațiul tău de lucru. Am păstrat doar URL-urile accesibile.
Acest exercițiu face parte din cursul
Programare funcțională intermediară cu purrr
Instrucțiuni pentru exercițiu
Încarcă
purrrșihttr.Compune un extractor de stare folosind
GET()șistatus_code().Testează această nouă funcție pe "https://www.thinkr.fr" și "https://en.wikipedia.org".
Aplică această funcție direct pe vectorul
urlscumap().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)