Curățare și numărare
Elimină cuvintele de oprire pentru a explora conținutul tweet-urilor clasificate ca reclamații în twitter_data.
Acest exercițiu face parte din cursul
Introducere în analiza textului în R
Instrucțiuni pentru exercițiu
- Tokenizează tweet-urile din
twitter_data. Numește coloana cu cuvintele tokenizateword. - Elimină cuvintele de oprire implicite din
twitter_datatokenizat. - Filtrează pentru a păstra doar reclamațiile.
- Calculează numărul de apariții ale cuvintelor folosind textul tokenizat și curățat, apoi ordonează descrescător după numărul de apariții.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)