Začněte nyníZačněte zdarma

Praxe s TFIDF

Dříve jsi pracoval/a s reprezentací bag-of-words pro články o surové ropě. Výpočet hodnot TFIDF z této reprezentace vychází, ale navíc zohledňuje, jak často se slovo vyskytuje v daném článku a jak často se objevuje v celé kolekci článků.

Abys zjistil/a, jak smysluplná jsou jednotlivá slova při porovnávání různých článků, vypočítej váhy TFIDF pro slova v datové sadě crude – kolekci 20 článků o surové ropě.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej hodnoty TFIDF pro crude podle article_id a word. Výsledný tibble ulož jako crude_weights.
  • Seřaď crude_weights pomocí funkce arrange() sestupně podle hodnot tf_idf.
  • Vyfiltruj z crude_weights nejnižší nenulové hodnoty tf_idf. Opět použij funkci arrange.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
Upravit a spustit kód