Practică TFIDF
Anterior ai analizat o reprezentare de tip bag-of-words a articolelor despre petrol brut. Calcularea valorilor TFIDF se bazează pe această reprezentare, dar ține cont și de frecvența cu care un cuvânt apare într-un articol, respectiv în întreaga colecție de articole.
Pentru a determina cât de relevante sunt cuvintele atunci când compari articole diferite, calculează ponderile TFIDF pentru cuvintele din crude, o colecție de 20 de articole despre petrol brut.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Calculează valorile TFIDF pentru
crudedupăarticle_idși dupăword. Salvează tibble-ul rezultat cacrude_weights. - Sortează
crude_weightscu funcțiaarrange()în ordinea descrescătoare a valorilortf_idf. - Filtrează
crude_weightspentru a obține cele mai mici valoritf_idfnenule. Folosește din nou funcțiaarrange.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)