Zacznij terazZacznij za darmo

Przygotowanie danych

Podczas wyborów prezydenckich w USA w 2016 roku rosyjskie boty tweetujące nieustannie rozpowszechniały treści polityczne skierowane zarówno do demokratów, jak i do republikanów. Otrzymujesz zbiór danych takich tweetów o nazwie russian_tweets. Twoim zadaniem jest sklasyfikowanie tych tweetów jako lewicowe (demokratyczne) lub prawicowe (republikańskie). Zanim zbudujesz model klasyfikacji, musisz oczyścić i przygotować tekst do modelowania.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Zakończ proces tokenizacji, przeprowadzając stemming tokenów.
  • Użyj funkcji cast_dtm(), aby utworzyć macierz dokumentów i terminów.
  • Zastosuj ważenie tfidf do macierzy dokumentów i terminów.
  • Wyświetl macierz.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Edytuj i uruchom kod