开始使用免费开始使用

TFIDF 实战

之前,您已经查看过关于原油文章的词袋表示。计算 TFIDF 值依赖这种词袋表示,但会同时考虑某个词在一篇文章中出现的频率,以及该词在整个文章集合中的出现频率。

为判断在比较不同文章时哪些词更有意义,请为 crude(一个包含 20 篇原油相关文章的集合)中的词计算 TFIDF 权重。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • article_idwordcrude 计算 TFIDF 值。将得到的 tibble 保存为 crude_weights
  • 使用 arrange() 函数按 tf_idf 值降序对 crude_weights 排序。
  • crude_weights 筛选为最小的非零 tf_idf 值。同样使用 arrange 函数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
编辑并运行代码