Powrót do pracy
Nadal pracujesz jako analityk danych w agencji webowej i dostałeś(-aś) zadanie polegające na web scrapingu. Masz do dyspozycji listę adresów URL do przeanalizowania – to analiza, którą zacząłeś(-ęłaś) już w poprzednim rozdziale.
Spodziewasz się, że to zadanie będzie się powtarzać: za kilka tygodni prawdopodobnie zostaniesz poproszony(-a) o zrobienie tego samego. Żeby ułatwić sobie przyszłą pracę, postanawiasz już dziś napisać przejrzysty kod, do którego łatwo będzie wrócić później.
Zaczniemy od połączenia dwóch funkcji z pakietu httr, które poznałeś(-aś) w poprzednim rozdziale: GET() – do pobierania strony internetowej – oraz status_code() – do wyodrębnienia kodu statusu. W ten sposób utworzymy ekstraktor kodu statusu.
Wektor urls jest nadal dostępny w twoim środowisku pracy. Zachowaliśmy tylko te adresy URL, które są osiągalne.
To ćwiczenie jest częścią kursu
Funkcyjne programowanie średnio zaawansowane z purrr
Instrukcje do ćwiczenia
Załaduj pakiety
purrrihttr.Skomponuj ekstraktor statusu, używając funkcji
GET()istatus_code().Przetestuj nową funkcję na adresach "https://www.thinkr.fr" oraz "https://en.wikipedia.org".
Zastosuj tę funkcję bezpośrednio na wektorze
urlsza pomocąmap().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)