Začněte nyníZačněte zdarma

Čištění a počítání

Odstraň stop slova a prozkoumej obsah tweetů z twitter_data, které byly označeny jako stížnosti.

Toto cvičení je součástí kurzu

Úvod do analýzy textu v R

Zobrazit kurz

Pokyny k cvičení

  • Tokenizuj tweety v twitter_data. Sloupec s tokenizovanými slovy pojmenuj word.
  • Odstraň výchozí stop slova z tokenizovaného twitter_data.
  • Vyfiltruj pouze stížnosti.
  • Spočítej frekvenci slov v tokenizovaném a vyčištěném textu a seřaď výsledky sestupně podle počtu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Upravit a spustit kód