URLs analysieren
Wir arbeiten weiterhin mit dem #RStudioConf-Datensatz. In dieser Übung konzentrieren wir uns darauf, die in den Tweets enthaltenen URLs zu analysieren.
Die URLs findest du in einem Element namens "url_urls". Diese "url_urls"-Elemente enthalten entweder NULL, wenn der Tweet keine URL hatte, oder eine Liste mit einer oder mehreren URLs.
Wir beginnen damit, alle "url_urls"-Elemente aus dem Datensatz zu extrahieren und kombinieren dann purrr und stringr, um zu zählen, wie viele Tweets auf eine GitHub-bezogene URL verlinken. Da GitHub eine beliebte Website für Developer ist, deutet eine hohe Häufigkeit dieser Website auf eine starke Developer-Community in unserem Datensatz hin.
purrr und stringr sind für dich geladen, und der rstudioconf-Datensatz ist weiterhin in deinem Workspace verfügbar.
Diese Übung ist Teil des Kurses
<Kurs>Fortgeschrittene funktionale Programmierung mit purrr</Kurs>Übungsanweisungen
Extrahiere alle
"urls_url"-Elemente und übergib das Ergebnis anflatten(), um eine Hierarchieebene zu entfernen.Entferne die
NULLaus den Ergebnissen.Erstelle einen Mapper namens
has_github, der erkennt, ob eine Zeichenkette"github"enthält.Verwende die logische
map_*()-Variante mithas_githubund übergib das Ergebnis ansum(), um die Anzahl der Links zu zählen, die"github"enthalten.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()