ÎncepețiÎncepe gratuit

Curățare și numărare

Elimină cuvintele de oprire pentru a explora conținutul tweet-urilor clasificate ca reclamații în twitter_data.

Acest exercițiu face parte din cursul

Introducere în analiza textului în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Tokenizează tweet-urile din twitter_data. Numește coloana cu cuvintele tokenizate word.
  • Elimină cuvintele de oprire implicite din twitter_data tokenizat.
  • Filtrează pentru a păstra doar reclamațiile.
  • Calculează numărul de apariții ale cuvintelor folosind textul tokenizat și curățat, apoi ordonează descrescător după numărul de apariții.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Editează și rulează codul