Zacznij terazZacznij za darmo

Macierze rzadkie

W lekcji wideo poznałeś/aś macierze rzadkie. Wraz ze wzrostem liczby dokumentów tekstowych i unikalnych słów macierze rzadkie mogą stać się prawdziwym wyzwaniem obliczeniowym. Tworzenie reprezentacji słów na podstawie tweetów bardzo łatwo prowadzi do macierzy rzadkich – wszystko za sprawą emotikonów, slangu, skrótowców i innych form języka używanych w mediach społecznościowych.

W tym ćwiczeniu przejdziesz przez kolejne kroki obliczania stopnia rzadkości zbioru rosyjskich tweetów. To mały przykład, który dobrze pokazuje, jak szybko analiza tekstu może przerodzić się w poważny problem obliczeniowy.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
Edytuj i uruchom kod