Zacznij terazZacznij za darmo

Ćwiczenie z TFIDF

Wcześniej analizowałeś reprezentację bag-of-words artykułów dotyczących ropy naftowej. Obliczanie wartości TFIDF opiera się na tej reprezentacji, ale uwzględnia również to, jak często dane słowo pojawia się w artykule oraz jak często występuje w całej kolekcji artykułów.

Aby sprawdzić, jak istotne są poszczególne słowa przy porównywaniu różnych artykułów, oblicz wagi TFIDF dla słów w zbiorze crude – kolekcji 20 artykułów o ropie naftowej.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz wartości TFIDF dla zbioru crude według article_id i word. Zapisz wynikowy obiekt tibble jako crude_weights.
  • Posortuj crude_weights za pomocą funkcji arrange() malejąco według wartości tf_idf.
  • Przefiltruj crude_weights, aby wyświetlić najniższe niezerowe wartości tf_idf. Ponownie użyj funkcji arrange.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
Edytuj i uruchom kod