Praxe s TFIDF
Dříve jsi pracoval/a s reprezentací bag-of-words pro články o surové ropě. Výpočet hodnot TFIDF z této reprezentace vychází, ale navíc zohledňuje, jak často se slovo vyskytuje v daném článku a jak často se objevuje v celé kolekci článků.
Abys zjistil/a, jak smysluplná jsou jednotlivá slova při porovnávání různých článků, vypočítej váhy TFIDF pro slova v datové sadě crude – kolekci 20 článků o surové ropě.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Vypočítej hodnoty TFIDF pro
crudepodlearticle_idaword. Výsledný tibble ulož jakocrude_weights. - Seřaď
crude_weightspomocí funkcearrange()sestupně podle hodnottf_idf. - Vyfiltruj z
crude_weightsnejnižší nenulové hodnotytf_idf. Opět použij funkciarrange.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)