Zacznij terazZacznij za darmo

Czyszczenie i zliczanie

Usuń słowa stopu, aby zbadać treść tweetów z linii lotniczych zaklasyfikowanych jako skargi w zbiorze twitter_data.

To ćwiczenie jest częścią kursu

Wprowadzenie do analizy tekstu w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Przeprowadź tokenizację tweetów w zbiorze twitter_data. Nadaj kolumnie z tokenizowanymi słowami nazwę word.
  • Usuń domyślne słowa stopu z tokenizowanego zbioru twitter_data.
  • Odfiltruj dane tak, aby zachować tylko skargi.
  • Oblicz liczbę wystąpień słów na podstawie oczyszczonego, tokenizowanego tekstu i posortuj wyniki malejąco według liczby wystąpień.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Edytuj i uruchom kod