Analiza adresów URL
Kontynuujemy eksplorację zbioru danych #RStudioConf. W tym ćwiczeniu skupimy się na analizie adresów URL zawartych w tweetach.
Adresy URL znajdują się w elemencie o nazwie "url_urls". Elementy "url_urls" zawierają albo NULL, jeśli tweet nie miał żadnego URL-a, albo listę jednego lub więcej adresów.
Zaczniemy od wyodrębnienia wszystkich elementów "url_urls" ze zbioru danych, a następnie połączymy purrr z stringr, aby policzyć, ile tweetów zawiera link do adresu URL związanego z GitHubem. Ponieważ GitHub jest popularnym serwisem wśród programistów, wysoka częstotliwość jego występowania wskaże na silną społeczność developerów w naszym zbiorze danych.
Biblioteki purrr i stringr są już wczytane, a zbiór danych rstudioconf jest nadal dostępny w twoim środowisku.
To ćwiczenie jest częścią kursu
Funkcyjne programowanie średnio zaawansowane z purrr
Instrukcje do ćwiczenia
Wyodrębnij wszystkie elementy
"urls_url"i przekaż wynik do funkcjiflatten(), aby usunąć jeden poziom zagnieżdżenia.Usuń wartości
NULLz wyników.Utwórz mapper o nazwie
has_github, który wykrywa, czy ciąg znaków zawiera"github".Użyj wariantu
map_*()zwracającego wartości logiczne wraz zhas_github, a wynik przekaż do funkcjisum(), aby policzyć liczbę linków zawierających"github".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()