Tokenizace a počítání slov
Prozkoumej obsah tweetů o leteckých společnostech v datasetu twitter_data pomocí počtů slov. Obsah každého tweetu najdeš ve sloupci tweet_text.
Toto cvičení je součástí kurzu
Úvod do analýzy textu v R
Pokyny k cvičení
- Načti balíčky tidyverse a tidytext.
- Tokenizuj tweety ve sloupci
tweet_text. - Vypočítej počty slov z tokenizovaného textu.
- Seřaď počty sestupně.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the tidyverse and tidytext packages
___(___)
___(___)
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(word, ___)
tidy_twitter %>%
# Compute word counts
___(___) %>%
# Arrange the counts in descending order
___(___)