Kom igångKom igång gratis

Analysera URL:er

Vi fortsätter att utforska #RStudioConf-datasetet. I den här övningen fokuserar vi på att analysera URL:erna i tweets.

URL:erna finns i ett element som heter "url_urls". Dessa "url_urls"-element innehåller antingen NULL om tweeten inte hade någon URL, eller en lista med en eller flera URL:er.

Vi börjar med att extrahera alla "url_urls"-element från datasetet, och sedan kombinerar vi purrr och stringr för att räkna hur många tweets som innehåller en länk till en GitHub-relaterad URL. Eftersom GitHub är en populär webbplats bland utvecklare indikerar en hög förekomst av den att vår datamängd innehåller en stark utvecklargemenskap.

purrr och stringr är redan inlästa, och datasetet rstudioconf är fortfarande tillgängligt i din arbetsmiljö.

Den här övningen är en del av kursen

Funktionell programmering på mellannivå med purrr

Visa kurs

Övningsinstruktioner

  • Extrahera alla "urls_url"-element och skicka resultatet till flatten() för att ta bort en nivå i hierarkin.

  • Ta bort NULL-värden från resultatet.

  • Skapa en mapper som heter has_github, vilken identifierar om en teckensträng innehåller "github".

  • Använd den map_*()-variant som returnerar logiska värden tillsammans med has_github, och skicka resultatet till sum() för att räkna antalet länkar som innehåller "github".

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Redigera och kör kod