Rensa och räkna
Ta bort stoppord för att utforska innehållet i enbart de flygbolagstweets som klassificerats som klagomål i twitter_data.
Den här övningen är en del av kursen
Introduktion till textanalys i R
Övningsinstruktioner
- Tokenisera tweetsen i
twitter_data. Ge kolumnen med tokeniserade ord namnetword. - Ta bort standardstopporden från den tokeniserade
twitter_data. - Filtrera för att behålla enbart klagomålen.
- Beräkna ordfrekvenser med hjälp av den tokeniserade, rensade texten och sortera i fallande ordning efter antal.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)