Tokenisering och ordräkning
Utforska innehållet i flygbolagstweetsen i twitter_data med hjälp av ordräkning. Innehållet i varje tweet finns i kolumnen tweet_text.
Den här övningen är en del av kursen
Introduktion till textanalys i R
Övningsinstruktioner
- Ladda in paketen tidyverse och tidytext.
- Tokenisera tweetsen i kolumnen
tweet_text. - Beräkna ordfrekvenser med hjälp av den tokeniserade texten.
- Sortera resultaten i fallande ordning.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the tidyverse and tidytext packages
___(___)
___(___)
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(word, ___)
tidy_twitter %>%
# Compute word counts
___(___) %>%
# Arrange the counts in descending order
___(___)