Ćwiczenie z TFIDF
Wcześniej analizowałeś reprezentację bag-of-words artykułów dotyczących ropy naftowej. Obliczanie wartości TFIDF opiera się na tej reprezentacji, ale uwzględnia również to, jak często dane słowo pojawia się w artykule oraz jak często występuje w całej kolekcji artykułów.
Aby sprawdzić, jak istotne są poszczególne słowa przy porównywaniu różnych artykułów, oblicz wagi TFIDF dla słów w zbiorze crude – kolekcji 20 artykułów o ropie naftowej.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Oblicz wartości TFIDF dla zbioru
crudewedługarticle_idiword. Zapisz wynikowy obiekt tibble jakocrude_weights. - Posortuj
crude_weightsza pomocą funkcjiarrange()malejąco według wartościtf_idf. - Przefiltruj
crude_weights, aby wyświetlić najniższe niezerowe wartościtf_idf. Ponownie użyj funkcjiarrange.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)