Začněte nyníZačněte zdarma

Příprava dat

Během amerických voleb v roce 2016 byly využívány ruské twitterové boty k neustálému šíření politické rétoriky mezi demokraty i republikány. Máš k dispozici dataset takových tweetů s názvem russian_tweets. Tvým úkolem je klasifikovat tyto tweety jako levicové (demokratické) nebo pravicové (republikánské). Než budeš moci sestavit klasifikační model, musíš text vyčistit a připravit pro modelování.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Dokonči proces tokenizace stemováním tokenů.
  • Pomocí cast_dtm() vytvoř matici dokumentů a termínů.
  • Matici dokumentů a termínů ohodnoť pomocí vážení tfidf.
  • Vypiš matici.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Upravit a spustit kód