Začněte nyníZačněte zdarma

Tokenizace a počítání slov

Prozkoumej obsah tweetů o leteckých společnostech v datasetu twitter_data pomocí počtů slov. Obsah každého tweetu najdeš ve sloupci tweet_text.

Toto cvičení je součástí kurzu

Úvod do analýzy textu v R

Zobrazit kurz

Pokyny k cvičení

  • Načti balíčky tidyverse a tidytext.
  • Tokenizuj tweety ve sloupci tweet_text.
  • Vypočítej počty slov z tokenizovaného textu.
  • Seřaď počty sestupně.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the tidyverse and tidytext packages
___(___)
___(___)

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(word, ___) 

tidy_twitter %>% 
  # Compute word counts
  ___(___) %>% 
  # Arrange the counts in descending order
  ___(___)
Upravit a spustit kód