Kom igångKom igång gratis

Rensa och räkna

Ta bort stoppord för att utforska innehållet i enbart de flygbolagstweets som klassificerats som klagomål i twitter_data.

Den här övningen är en del av kursen

Introduktion till textanalys i R

Visa kurs

Övningsinstruktioner

  • Tokenisera tweetsen i twitter_data. Ge kolumnen med tokeniserade ord namnet word.
  • Ta bort standardstopporden från den tokeniserade twitter_data.
  • Filtrera för att behålla enbart klagomålen.
  • Beräkna ordfrekvenser med hjälp av den tokeniserade, rensade texten och sortera i fallande ordning efter antal.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Redigera och kör kod