Czyszczenie i zliczanie
Usuń słowa stopu, aby zbadać treść tweetów z linii lotniczych zaklasyfikowanych jako skargi w zbiorze twitter_data.
To ćwiczenie jest częścią kursu
Wprowadzenie do analizy tekstu w R
Instrukcje do ćwiczenia
- Przeprowadź tokenizację tweetów w zbiorze
twitter_data. Nadaj kolumnie z tokenizowanymi słowami nazwęword. - Usuń domyślne słowa stopu z tokenizowanego zbioru
twitter_data. - Odfiltruj dane tak, aby zachować tylko skargi.
- Oblicz liczbę wystąpień słów na podstawie oczyszczonego, tokenizowanego tekstu i posortuj wyniki malejąco według liczby wystąpień.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)