Đám mây từ đơn giản
Đến lúc này, bạn đã uống quá nhiều cà phê. Thêm vào đó, việc thấy các từ đứng đầu như "shop", "morning" và "drinking" cùng nhiều từ khác cũng không mang lại nhiều insight.
Để ăn mừng khi đã đi được đến đây, hãy thử xử lý thêm một lô 1000 tweet khác. Tạm thời, bạn chưa biết chúng có điểm chung gì, nhưng hãy xem liệu bạn có thể đoán ra bằng một đám mây từ không. Các giá trị tần suất thuật ngữ của các tweet đã được nạp sẵn trong workspace của bạn.
Đám mây từ là một cách trực quan hóa các thuật ngữ. Trong đám mây từ, kích thước thường được tỷ lệ theo tần suất, và ở một số trường hợp, màu sắc có thể thể hiện một thước đo khác. Hiện tại, ta sẽ giữ mọi thứ đơn giản: kích thước gắn với tần suất của từng từ, và ta chỉ chọn một màu duy nhất.
Như bạn đã thấy trong video, hàm wordcloud() hoạt động như sau:
wordcloud(words, frequencies, max.words = 500, colors = "blue")
Phân tích khai phá văn bản thường bao gồm các đám mây từ đơn giản. Thực tế, chúng có lẽ bị lạm dụng, nhưng vẫn hữu ích để nhanh chóng hiểu một tập văn bản!
term_frequency đã được nạp vào workspace của bạn.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Nạp package
wordcloud. - In ra 10 phần tử đầu tiên trong
term_frequency. - Trích xuất các thuật ngữ bằng
names()trênterm_frequency. Đặt tên vector chuỗi làterms_vec. - Tạo một
wordcloud()dùngterms_veclàm danh sách từ vàterm_frequencylàm giá trị. Thêm các tham sốmax.words = 50vàcolors = "red".
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load wordcloud package
# Print the first 10 entries in term_frequency
# Vector of terms
# Create a word cloud for the values in word_freqs