ÎncepețiÎncepe gratuit

Practică TFIDF

Anterior ai analizat o reprezentare de tip bag-of-words a articolelor despre petrol brut. Calcularea valorilor TFIDF se bazează pe această reprezentare, dar ține cont și de frecvența cu care un cuvânt apare într-un articol, respectiv în întreaga colecție de articole.

Pentru a determina cât de relevante sunt cuvintele atunci când compari articole diferite, calculează ponderile TFIDF pentru cuvintele din crude, o colecție de 20 de articole despre petrol brut.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează valorile TFIDF pentru crude după article_id și după word. Salvează tibble-ul rezultat ca crude_weights.
  • Sortează crude_weights cu funcția arrange() în ordinea descrescătoare a valorilor tf_idf.
  • Filtrează crude_weights pentru a obține cele mai mici valori tf_idf nenule. Folosește din nou funcția arrange.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
Editează și rulează codul