Identyfikowanie profili
Nadal pracujemy nad eksploracją naszego zbioru danych z tweetami. Elementy te są zawarte w zagnieżdżonej liście 5055 podlist, którą przeglądamy za pomocą purrr.
W tym ćwiczeniu odpowiemy na pytanie dotyczące zachowań użytkowników: ilu z nich tylko retweetuje, nie publikując żadnych „oryginalnych treści"? Popularna zasada na Twitterze mówi, że około 80% użytkowników tylko retweetuje, a 20% tworzy własne treści – zgodnie z prawem Pareto. Sprawdzimy to w tym ćwiczeniu.
W tym celu podzielimy nasz zbiór danych na dwie części, a następnie policzymy łączną liczbę użytkowników oraz ilu z nich należy wyłącznie do grupy „tylko retweety".
purrr jest już załadowany, a lista rstudioconf jest nadal dostępna w twoim środowisku pracy.
To ćwiczenie jest częścią kursu
Funkcyjne programowanie średnio zaawansowane z purrr
Instrukcje do ćwiczenia
Utwórz podlistę retweetów, wyodrębnij element
user_idi usuń duplikaty za pomocąunique().Utwórz podlistę oryginalnych tweetów, wyodrębnij element
user_idi usuń duplikaty za pomocąunique().Połącz funkcje
union()(z bazowego R) ilength(), aby poznać łączną liczbę użytkowników.Użyj funkcji
setdiff()(z bazowego R), aby wyodrębnić użytkowników należących wyłącznie do podlisty retweetów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
___("user_id") %>%
___()
# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
___("user_id") %>%
___()
# Determine the total number of users
___(rt, non_rt) %>% ___()
# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()