Zacznij terazZacznij za darmo

Przykład worka słów (BoW)

Podczas przeglądów literatury badacze czytają i streszczają jak najwięcej dostępnych tekstów na dany temat. Zdarza się, że trafiają na duplikaty artykułów lub streszczenia tekstów, które już czytali. Masz do dyspozycji 20 artykułów o ropie naftowej zapisanych w obiekcie R o nazwie crude_tibble. Zamiast od razu zagłębiać się w każdy artykuł, postanawiasz najpierw sprawdzić, jakie słowa pojawiają się w wielu z nich. W tym celu zaczniesz od zbudowania reprezentacji tekstu w postaci worka słów (bag-of-words).

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz reprezentację BoW, zliczając liczbę słów według artykułu z użyciem kolumny article_id.
  • Korzystając z wyniku, sprawdź, ile unikalnych kombinacji artykuł/słowo zostało utworzonych.
  • Przefiltruj wyniki do wzmianek o 'prices'.
  • W ilu artykułach pojawia się słowo prices?

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Count occurrence by article_id and word
words <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(___, ___, sort=TRUE)

# How many different word/article combinations are there?
unique_combinations <- nrow(___)

# Filter to responses with the word "prices"
words_with_prices <- words %>%
  ___(word == "___")

# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)
Edytuj i uruchom kod