Macierze rzadkie
W lekcji wideo poznałeś/aś macierze rzadkie. Wraz ze wzrostem liczby dokumentów tekstowych i unikalnych słów macierze rzadkie mogą stać się prawdziwym wyzwaniem obliczeniowym. Tworzenie reprezentacji słów na podstawie tweetów bardzo łatwo prowadzi do macierzy rzadkich – wszystko za sprawą emotikonów, slangu, skrótowców i innych form języka używanych w mediach społecznościowych.
W tym ćwiczeniu przejdziesz przez kolejne kroki obliczania stopnia rzadkości zbioru rosyjskich tweetów. To mały przykład, który dobrze pokazuje, jak szybko analiza tekstu może przerodzić się w poważny problem obliczeniowy.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)