ÎncepețiÎncepe gratuit

Pregătirea datelor

În timpul alegerilor prezidențiale din SUA din 2016, boți ruși de pe Twitter au fost utilizați pentru a distribui constant mesaje politice atât democraților, cât și republicanilor. Ai primit un set de date cu astfel de tweet-uri, numit russian_tweets. Ai decis să clasifici aceste tweet-uri ca fiind de stânga (democrate) sau de dreapta (republicane). Înainte de a construi un model de clasificare, trebuie să curești și să pregătești textul pentru modelare.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Finalizează procesul de tokenizare prin aplicarea stemmingului asupra tokenilor.
  • Folosește cast_dtm() pentru a crea o matrice document-termen.
  • Ponderează matricea document-termen folosind ponderarea tfidf.
  • Afișează matricea.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Editează și rulează codul