LoslegenKostenlos starten

URLs analysieren

Wir arbeiten weiterhin mit dem #RStudioConf-Datensatz. In dieser Übung konzentrieren wir uns darauf, die in den Tweets enthaltenen URLs zu analysieren.

Die URLs findest du in einem Element namens "url_urls". Diese "url_urls"-Elemente enthalten entweder NULL, wenn der Tweet keine URL hatte, oder eine Liste mit einer oder mehreren URLs.

Wir beginnen damit, alle "url_urls"-Elemente aus dem Datensatz zu extrahieren und kombinieren dann purrr und stringr, um zu zählen, wie viele Tweets auf eine GitHub-bezogene URL verlinken. Da GitHub eine beliebte Website für Developer ist, deutet eine hohe Häufigkeit dieser Website auf eine starke Developer-Community in unserem Datensatz hin.

purrr und stringr sind für dich geladen, und der rstudioconf-Datensatz ist weiterhin in deinem Workspace verfügbar.

Diese Übung ist Teil des Kurses

<Kurs>Fortgeschrittene funktionale Programmierung mit purrr</Kurs>
Kurs ansehen

Übungsanweisungen

  • Extrahiere alle "urls_url"-Elemente und übergib das Ergebnis an flatten(), um eine Hierarchieebene zu entfernen.

  • Entferne die NULL aus den Ergebnissen.

  • Erstelle einen Mapper namens has_github, der erkennt, ob eine Zeichenkette "github" enthält.

  • Verwende die logische map_*()-Variante mit has_github und übergib das Ergebnis an sum(), um die Anzahl der Links zu zählen, die "github" enthalten.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Code bearbeiten und ausführen