Čištění a počítání
Odstraň stop slova a prozkoumej obsah tweetů z twitter_data, které byly označeny jako stížnosti.
Toto cvičení je součástí kurzu
Úvod do analýzy textu v R
Pokyny k cvičení
- Tokenizuj tweety v
twitter_data. Sloupec s tokenizovanými slovy pojmenujword. - Odstraň výchozí stop slova z tokenizovaného
twitter_data. - Vyfiltruj pouze stížnosti.
- Spočítej frekvenci slov v tokenizovaném a vyčištěném textu a seřaď výsledky sestupně podle počtu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)