Analysera URL:er
Vi fortsätter att utforska #RStudioConf-datasetet. I den här övningen fokuserar vi på att analysera URL:erna i tweets.
URL:erna finns i ett element som heter "url_urls". Dessa "url_urls"-element innehåller antingen NULL om tweeten inte hade någon URL, eller en lista med en eller flera URL:er.
Vi börjar med att extrahera alla "url_urls"-element från datasetet, och sedan kombinerar vi purrr och stringr för att räkna hur många tweets som innehåller en länk till en GitHub-relaterad URL. Eftersom GitHub är en populär webbplats bland utvecklare indikerar en hög förekomst av den att vår datamängd innehåller en stark utvecklargemenskap.
purrr och stringr är redan inlästa, och datasetet rstudioconf är fortfarande tillgängligt i din arbetsmiljö.
Den här övningen är en del av kursen
Funktionell programmering på mellannivå med purrr
Övningsinstruktioner
Extrahera alla
"urls_url"-element och skicka resultatet tillflatten()för att ta bort en nivå i hierarkin.Ta bort
NULL-värden från resultatet.Skapa en mapper som heter
has_github, vilken identifierar om en teckensträng innehåller"github".Använd den
map_*()-variant som returnerar logiska värden tillsammans medhas_github, och skicka resultatet tillsum()för att räkna antalet länkar som innehåller"github".
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()