Từ dừng và đám mây từ
Giờ bạn đã vào đúng “tâm thế” khai phá văn bản, đang nhâm nhi một ly chardonnay, hãy đào sâu hơn. Ở đám mây từ trước, "chardonnay" chiếm lĩnh toàn bộ hình. Nó trội đến mức bạn không thể rút ra thêm insight thú vị nào khác.
Hãy thay đổi danh sách từ dừng để bổ sung "chardonnay" nhằm xem những từ nào khác cũng phổ biến nhưng trước đó đã bị lấn át.
Không gian làm việc của bạn có một phiên bản đã làm sạch các tweet về chardonnay, nhưng giờ hãy loại bỏ thêm vài từ không mang lại insight. Bài tập này dùng content() để hiển thị một tweet cụ thể cho bạn so sánh. Nhớ dùng hai dấu ngoặc vuông để đánh chỉ mục danh sách corpus.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Áp dụng
content()lên tài liệu thứ 24 trongchardonnay_corp. - Thêm
"chardonnay"vào danh sách từ dừng tiếng Anh và gán vàostops. - Xem sáu từ cuối cùng trong
stops. - Tạo
cleaned_chardonnay_corpvớitm_map()bằng cách truyền vàochardonnay_corp, hàmremoveWords()và cuối cùng là danh sách từ dừngstops. - Giờ hãy xem lại
contentcủa tweet thứ24để so sánh kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])