Đám mây so sánh (Comparison Cloud)
Bài tập này sẽ tạo một dạng trực quan phổ biến để bạn hiểu về tần suất thuật ngữ. Cụ thể, bạn sẽ xem các thuật ngữ xuất hiện nhiều nhất trong hai tài liệu gộp của nhóm tích cực và tiêu cực. Nhớ lại TermDocumentMatrix all_tdm bạn đã tạo trước đó. Thay vì 1000 đánh giá thuê nhà riêng lẻ, ma trận này có 2 tài liệu chứa toàn bộ đánh giá, được tách theo điểm polarity().
Thông thường, việc chuyển TDM thành ma trận sẽ dễ làm việc hơn. Từ đó, bạn chỉ cần đổi tên các cột. Lưu ý rằng hàm colnames() được gọi ở vế trái của toán tử gán như minh họa dưới đây.
colnames(OBJECT) <- c("COLUMN_NAME1", "COLUMN_NAME2")
Sau khi xong, bạn sẽ sắp xếp lại ma trận để xem các từ tích cực và tiêu cực nhất. Xem lại các thuật ngữ này để bạn có thể trả lời các bài tập kết luận!
Cuối cùng, bạn sẽ trực quan hóa các thuật ngữ bằng comparison.cloud().
Bài tập này là một phần của khóa học
Phân tích cảm xúc trong R
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Matrix
___
# Column names
colnames(___) <- ___
# Top pos words
order_by_pos <- order(all_tdm_m[, ___], decreasing = ___)
# Review top 10 pos words
all_tdm_m[order_by_pos, ] %>% head(___)
# Top neg words
order_by_neg <- order(___, decreasing = ___)
# Review top 10 neg words
all_tdm_m[___, ] %>% ___