Kom igångKom igång gratis

TFIDF i praktiken

Tidigare studerade du en bag-of-words-representation av artiklar om råolja. Beräkning av TFIDF-värden bygger på den representationen, men tar även hänsyn till hur ofta ett ord förekommer i en artikel och hur ofta det förekommer i hela artikelsamlingen.

Beräkna TFIDF-vikterna för orden i crude – en samling med 20 artiklar om råolja – för att bedöma hur betydelsefulla orden är när du jämför olika artiklar.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Övningsinstruktioner

  • Beräkna TFIDF-värden för crude per article_id och per word. Spara den resulterande tibble:n som crude_weights.
  • Sortera crude_weights med funktionen arrange() i fallande ordning efter tf_idf-värden.
  • Filtrera crude_weights till de lägsta icke-noll-värdena för tf_idf. Använd även här funktionen arrange.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
Redigera och kör kod