Kom igångKom igång gratis

Dataförberedelse

Under det amerikanska valet 2016 användes ryska tweetbottar för att sprida politisk propaganda till både demokrater och republikaner. Du har fått tillgång till en datamängd med sådana tweets som heter russian_tweets. Din uppgift är att klassificera dessa tweets som antingen vänsterorienterade (demokrater) eller högerorienterade (republikaner). Innan du kan bygga en klassificeringsmodell behöver du rensa och förbereda texten för modellering.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Övningsinstruktioner

  • Slutför tokeniseringsprocessen genom att stemma tokenerna.
  • Använd cast_dtm() för att skapa en dokument-term-matris.
  • Viktad dokument-term-matrisen med tfidf-viktning.
  • Skriv ut matrisen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Redigera och kör kod