Zacznij terazZacznij za darmo

Tokenizacja i zliczanie

Przeanalizuj zawartość tweetów lotniczych ze zbioru twitter_data, korzystając ze zliczania słów. Treść każdego tweeta znajduje się w kolumnie tweet_text.

To ćwiczenie jest częścią kursu

Wprowadzenie do analizy tekstu w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj pakiety tidyverse i tidytext.
  • Dokonaj tokenizacji tweetów z kolumny tweet_text.
  • Oblicz liczbę wystąpień słów na podstawie stokenizowanego tekstu.
  • Posortuj wyniki malejąco według liczby wystąpień.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the tidyverse and tidytext packages
___(___)
___(___)

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(word, ___) 

tidy_twitter %>% 
  # Compute word counts
  ___(___) %>% 
  # Arrange the counts in descending order
  ___(___)
Edytuj i uruchom kod