LoslegenKostenlos starten

Profile identifizieren

Wir arbeiten weiter an der Exploration unseres Tweet-Datensatzes. Die Elemente liegen in einer verschachtelten Liste mit 5055 Unterlisten vor, die wir mit purrr untersuchen.

In dieser Übung beantworten wir eine Frage zum Verhalten der Nutzer:innen: Wie viele haben ausschließlich retweetet, ohne je „Original-Content“ zu veröffentlichen? Eine grobe Faustregel auf Twitter besagt, dass etwa 80 % der Menschen nur retweeten, während 20 % Inhalte veröffentlichen – entsprechend dem Pareto-Gesetz. Das überprüfen wir hier.

Dazu müssen wir unseren Datensatz in zwei Gruppen aufteilen und dann zählen, wie viele Nutzer:innen es insgesamt gibt und wie viele nur in der „nur Retweet“-Gruppe sind.

purrr wurde bereits für dich geladen, und die Liste rstudioconf ist weiterhin in deinem Arbeitsbereich verfügbar.

Diese Übung ist Teil des Kurses

<Kurs>Fortgeschrittene funktionale Programmierung mit purrr</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erstelle eine Unterliste der Retweets, extrahiere das Element user_id und entferne Duplikate mit unique().

  • Erstelle eine Unterliste der Original-Tweets, extrahiere das Element user_id und entferne Duplikate mit unique().

  • Kombiniere union() (aus Base R) und length(), um die Gesamtzahl der Nutzer:innen zu ermitteln.

  • Verwende die Funktion setdiff() (aus Base R), um die Nutzer:innen zu erhalten, die nur in der Retweet-Unterliste vorkommen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
  ___("user_id") %>% 
  ___()

# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
  ___("user_id") %>% 
  ___()

# Determine the total number of users
___(rt, non_rt) %>% ___()

# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()
Code bearbeiten und ausführen