Zacznij terazZacznij za darmo

Analiza adresów URL

Kontynuujemy eksplorację zbioru danych #RStudioConf. W tym ćwiczeniu skupimy się na analizie adresów URL zawartych w tweetach.

Adresy URL znajdują się w elemencie o nazwie "url_urls". Elementy "url_urls" zawierają albo NULL, jeśli tweet nie miał żadnego URL-a, albo listę jednego lub więcej adresów.

Zaczniemy od wyodrębnienia wszystkich elementów "url_urls" ze zbioru danych, a następnie połączymy purrr z stringr, aby policzyć, ile tweetów zawiera link do adresu URL związanego z GitHubem. Ponieważ GitHub jest popularnym serwisem wśród programistów, wysoka częstotliwość jego występowania wskaże na silną społeczność developerów w naszym zbiorze danych.

Biblioteki purrr i stringr są już wczytane, a zbiór danych rstudioconf jest nadal dostępny w twoim środowisku.

To ćwiczenie jest częścią kursu

Funkcyjne programowanie średnio zaawansowane z purrr

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyodrębnij wszystkie elementy "urls_url" i przekaż wynik do funkcji flatten(), aby usunąć jeden poziom zagnieżdżenia.

  • Usuń wartości NULL z wyników.

  • Utwórz mapper o nazwie has_github, który wykrywa, czy ciąg znaków zawiera "github".

  • Użyj wariantu map_*() zwracającego wartości logiczne wraz z has_github, a wynik przekaż do funkcji sum(), aby policzyć liczbę linków zawierających "github".

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Edytuj i uruchom kod