Tokenizacja i zliczanie
Przeanalizuj zawartość tweetów lotniczych ze zbioru twitter_data, korzystając ze zliczania słów. Treść każdego tweeta znajduje się w kolumnie tweet_text.
To ćwiczenie jest częścią kursu
Wprowadzenie do analizy tekstu w R
Instrukcje do ćwiczenia
- Wczytaj pakiety tidyverse i tidytext.
- Dokonaj tokenizacji tweetów z kolumny
tweet_text. - Oblicz liczbę wystąpień słów na podstawie stokenizowanego tekstu.
- Posortuj wyniki malejąco według liczby wystąpień.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the tidyverse and tidytext packages
___(___)
___(___)
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(word, ___)
tidy_twitter %>%
# Compute word counts
___(___) %>%
# Arrange the counts in descending order
___(___)