Przykład worka słów (BoW)
Podczas przeglądów literatury badacze czytają i streszczają jak najwięcej dostępnych tekstów na dany temat. Zdarza się, że trafiają na duplikaty artykułów lub streszczenia tekstów, które już czytali. Masz do dyspozycji 20 artykułów o ropie naftowej zapisanych w obiekcie R o nazwie crude_tibble. Zamiast od razu zagłębiać się w każdy artykuł, postanawiasz najpierw sprawdzić, jakie słowa pojawiają się w wielu z nich. W tym celu zaczniesz od zbudowania reprezentacji tekstu w postaci worka słów (bag-of-words).
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Utwórz reprezentację BoW, zliczając liczbę słów według artykułu z użyciem kolumny
article_id. - Korzystając z wyniku, sprawdź, ile unikalnych kombinacji artykuł/słowo zostało utworzonych.
- Przefiltruj wyniki do wzmianek o
'prices'. - W ilu artykułach pojawia się słowo
prices?
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Count occurrence by article_id and word
words <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(___, ___, sort=TRUE)
# How many different word/article combinations are there?
unique_combinations <- nrow(___)
# Filter to responses with the word "prices"
words_with_prices <- words %>%
___(word == "___")
# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)