Liên kết từ
Đúng như dự đoán, bạn thấy các chủ đề tương tự xuất hiện xuyên suốt cây phân cấp (dendrogram). Quay lại các nhận xét tích cực, bạn quyết định xem xét những cụm từ nổi bật đã xuất hiện trong word cloud. Bạn hy vọng tìm được các thuật ngữ liên quan bằng hàm findAssocs() từ tm. Giờ đây khi đã biết về giờ làm kéo dài và thiếu cân bằng công việc - cuộc sống, bạn muốn kiểm tra xem có điều gì bất ngờ không.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
Kho ngữ liệu amzn_pros_corp đã được làm sạch bằng các hàm tùy chỉnh như trước.
- Tạo TDM tên
amzn_p_tdmtừamzn_pros_corpvớicontrol = list(tokenize = tokenizer). - Tạo
amzn_p_mbằng cách chuyểnamzn_p_tdmsang matrix. - Tạo
amzn_p_freqbằng cách áp dụngrowSums()lênamzn_p_m. - Tạo
term_frequencybằng cách dùngsort()trênamzn_p_freqvới tham sốdecreasing = TRUE. - Xem 5 bigram đầu tiên bằng
term_frequency[1:5]. - Bạn có thể bất ngờ khi thấy "fast paced" là một thuật ngữ hàng đầu vì nó có thể mang nghĩa tiêu cực liên quan đến "long hours". Hãy xem các thuật ngữ liên quan nhất đến "fast paced". Dùng
findAssocs()trênamzn_p_tdmđể kiểm tra"fast paced"với ngưỡng0.2.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___