Tokenizare și numărare
Explorează conținutul tweet-urilor despre companii aeriene din twitter_data prin numărarea cuvintelor. Conținutul fiecărui tweet se află în coloana tweet_text.
Acest exercițiu face parte din cursul
Introducere în analiza textului în R
Instrucțiuni pentru exercițiu
- Încarcă pachetele tidyverse și tidytext.
- Tokenizează tweet-urile din coloana
tweet_text. - Calculează numărul de apariții ale cuvintelor folosind textul tokenizat.
- Ordonează rezultatele în ordine descrescătoare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the tidyverse and tidytext packages
___(___)
___(___)
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(word, ___)
tidy_twitter %>%
# Compute word counts
___(___) %>%
# Arrange the counts in descending order
___(___)