Zacznij terazZacznij za darmo

Powrót do pracy

Nadal pracujesz jako analityk danych w agencji webowej i dostałeś(-aś) zadanie polegające na web scrapingu. Masz do dyspozycji listę adresów URL do przeanalizowania – to analiza, którą zacząłeś(-ęłaś) już w poprzednim rozdziale.

Spodziewasz się, że to zadanie będzie się powtarzać: za kilka tygodni prawdopodobnie zostaniesz poproszony(-a) o zrobienie tego samego. Żeby ułatwić sobie przyszłą pracę, postanawiasz już dziś napisać przejrzysty kod, do którego łatwo będzie wrócić później.

Zaczniemy od połączenia dwóch funkcji z pakietu httr, które poznałeś(-aś) w poprzednim rozdziale: GET() – do pobierania strony internetowej – oraz status_code() – do wyodrębnienia kodu statusu. W ten sposób utworzymy ekstraktor kodu statusu.

Wektor urls jest nadal dostępny w twoim środowisku pracy. Zachowaliśmy tylko te adresy URL, które są osiągalne.

To ćwiczenie jest częścią kursu

Funkcyjne programowanie średnio zaawansowane z purrr

Zobacz kurs

Instrukcje do ćwiczenia

  • Załaduj pakiety purrr i httr.

  • Skomponuj ekstraktor statusu, używając funkcji GET() i status_code().

  • Przetestuj nową funkcję na adresach "https://www.thinkr.fr" oraz "https://en.wikipedia.org".

  • Zastosuj tę funkcję bezpośrednio na wektorze urls za pomocą map().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Edytuj i uruchom kod