TFIDF i praktiken
Tidigare studerade du en bag-of-words-representation av artiklar om råolja. Beräkning av TFIDF-värden bygger på den representationen, men tar även hänsyn till hur ofta ett ord förekommer i en artikel och hur ofta det förekommer i hela artikelsamlingen.
Beräkna TFIDF-vikterna för orden i crude – en samling med 20 artiklar om råolja – för att bedöma hur betydelsefulla orden är när du jämför olika artiklar.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Beräkna TFIDF-värden för
crudeperarticle_idoch perword. Spara den resulterande tibble:n somcrude_weights. - Sortera
crude_weightsmed funktionenarrange()i fallande ordning eftertf_idf-värden. - Filtrera
crude_weightstill de lägsta icke-noll-värdena förtf_idf. Använd även här funktionenarrange.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)