Dataförberedelse
Under det amerikanska valet 2016 användes ryska tweetbottar för att sprida politisk propaganda till både demokrater och republikaner. Du har fått tillgång till en datamängd med sådana tweets som heter russian_tweets. Din uppgift är att klassificera dessa tweets som antingen vänsterorienterade (demokrater) eller högerorienterade (republikaner). Innan du kan bygga en klassificeringsmodell behöver du rensa och förbereda texten för modellering.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Slutför tokeniseringsprocessen genom att stemma tokenerna.
- Använd
cast_dtm()för att skapa en dokument-term-matris. - Viktad dokument-term-matrisen med tfidf-viktning.
- Skriv ut matrisen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Stem the tokens
russian_tokens <- russian_tweets %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words) %>%
___(word = ___(word))
# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
count(tweet_id, word) %>%
___(document = ___, term = ___,
value = n, weighting = tm::___)
# Print the matrix details
___