TFIDF 实战
之前,您已经查看过关于原油文章的词袋表示。计算 TFIDF 值依赖这种词袋表示,但会同时考虑某个词在一篇文章中出现的频率,以及该词在整个文章集合中的出现频率。
为判断在比较不同文章时哪些词更有意义,请为 crude(一个包含 20 篇原油相关文章的集合)中的词计算 TFIDF 权重。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 按
article_id和word为crude计算 TFIDF 值。将得到的 tibble 保存为crude_weights。 - 使用
arrange()函数按tf_idf值降序对crude_weights排序。 - 将
crude_weights筛选为最小的非零tf_idf值。同样使用arrange函数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)