Luyện tập TFIDF
Trước đó, bạn đã xem biểu diễn bag-of-words của các bài viết về dầu thô. Việc tính giá trị TFIDF dựa trên biểu diễn bag-of-words này, nhưng đồng thời xét đến tần suất một từ xuất hiện trong một bài viết và tần suất từ đó xuất hiện trong toàn bộ tập bài viết.
Để đánh giá mức độ “có ý nghĩa” của các từ khi so sánh giữa các bài viết, hãy tính trọng số TFIDF cho các từ trong crude, một tập gồm 20 bài viết về dầu thô.
Bài tập này là một phần của khóa học
Nhập môn Xử lý Ngôn ngữ Tự nhiên với R
Hướng dẫn bài tập
- Tính các giá trị TFIDF cho
crudetheoarticle_idvà theoword. Lưu tibble kết quả làcrude_weights. - Sắp xếp
crude_weightsbằng hàmarrange()theotf_idfgiảm dần. - Lọc
crude_weightsđể lấy các giá trịtf_idfnhỏ nhất nhưng khác 0. Tiếp tục dùng hàmarrange.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)