ÎncepețiÎncepe gratuit

Înapoi la birou

Lucrezi în continuare ca analist de date pentru o agenție web și ți s-a cerut să faci web scraping. Ai primit o listă de URL-uri de analizat – o analiză pe care ai început-o deja în capitolul anterior.

Te aștepți ca această sarcină să fie recurentă: cu siguranță vei fi rugat să o repeți peste câteva săptămâni. Pentru a-ți ușura munca viitoare, ai decis să scrii cod curat astăzi, astfel încât să fie mai simplu să revii la el mai târziu.

Vom începe prin a combina cele două funcții din httr pe care le-am văzut în capitolul anterior: GET(), pentru a prelua pagina web, și status_code(), pentru a extrage codul de stare – în scopul de a crea un extractor de cod de stare.

Vectorul urls este disponibil în continuare în spațiul tău de lucru. Am păstrat doar URL-urile accesibile.

Acest exercițiu face parte din cursul

Programare funcțională intermediară cu purrr

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă purrr și httr.

  • Compune un extractor de stare folosind GET() și status_code().

  • Testează această nouă funcție pe "https://www.thinkr.fr" și "https://en.wikipedia.org".

  • Aplică această funcție direct pe vectorul urls cu map().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Editează și rulează codul