Pregătirea datelor
În timpul alegerilor prezidențiale din SUA din 2016, boți ruși de pe Twitter au fost utilizați pentru a distribui constant mesaje politice atât democraților, cât și republicanilor. Ai primit un set de date cu astfel de tweet-uri, numit russian_tweets. Ai decis să clasifici aceste tweet-uri ca fiind de stânga (democrate) sau de dreapta (republicane). Înainte de a construi un model de clasificare, trebuie să curești și să pregătești textul pentru modelare.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Finalizează procesul de tokenizare prin aplicarea stemmingului asupra tokenilor.
- Folosește
cast_dtm()pentru a crea o matrice document-termen. - Ponderează matricea document-termen folosind ponderarea tfidf.
- Afișează matricea.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Stem the tokens
russian_tokens <- russian_tweets %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words) %>%
___(word = ___(word))
# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
count(tweet_id, word) %>%
___(document = ___, term = ___,
value = n, weighting = tm::___)
# Print the matrix details
___