Các bigram ảnh hưởng đến word cloud như thế nào?
Bây giờ bạn đã tạo được một DTM dựa trên bigram, bạn có thể xem xét nó và tạo lại word cloud. Phương pháp tokenization mới không chỉ ảnh hưởng đến các ma trận mà còn tác động đến mọi trực quan hóa hoặc mô hình dựa trên các ma trận đó.
Bạn còn nhớ trong word cloud về chardonnay, "Marvin" và "Gaye" là hai thuật ngữ tách rời không? Với bigram, tokenization sẽ lấy tất cả các tổ hợp gồm hai từ. Hãy quan sát điều gì xảy ra với word cloud trong bài tập này.
Bài tập này dùng str_subset từ stringr. Lưu ý rằng các khóa học khác trên DataCamp trình bày chi tiết hơn về regular expression. Nhắc lại: ký tự đặc biệt ^ trong regular expression khớp với vị trí bắt đầu trong các bigram của bài tập.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
Các tweet về chardonnay đã được làm sạch và sắp xếp thành một DTM gọi là bigram_dtm.
- Tạo
bigram_dtm_mbằng cách chuyểnbigram_dtmthành ma trận. - Tạo đối tượng
freqgồm tần suất từ bằng cách áp dụngcolSums()lênbigram_dtm_m. - Trích xuất vector ký tự các tổ hợp từ bằng
names(freq)và gán kết quả chobi_words. - Truyền
bi_wordsvàostr_subset()với mẫu khớp"^marvin"để xem tất cả các bigram bắt đầu bằng "marvin". - Vẽ một
wordcloud()đơn giản bằng cách truyềnbi_words,freqvàmax.words = 15vào hàm.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create bigram_dtm_m
___ <- ___(___)
# Create freq
___ <- ___(___)
# Create bi_words
___ <- ___(___)
# Examine part of bi_words
___(___, ___)
# Plot a word cloud
___(___, ___, ___)