Trích xuất đặc trưng & phân tích: amzn_pros
amzn_pros_corp, amzn_cons_corp, goog_pros_corp và goog_cons_corp đều đã được tiền xử lý, vì vậy giờ bạn có thể trích xuất các đặc trưng muốn phân tích. Vì bạn đang dùng phương pháp bag of words, bạn quyết định tạo một TermDocumentMatrix bigram cho tập hợp đánh giá tích cực của Amazon, amzn_pros_corp. Từ đó, bạn có thể nhanh chóng tạo một wordcloud() để hiểu những cụm từ mà mọi người liên tưởng tích cực đến việc làm tại Amazon.
Hàm dưới đây dùng RWeka để token hóa hai từ và được sử dụng ngầm trong bài tập này.
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Tạo
amzn_p_tdmlà mộtTermDocumentMatrixtừamzn_pros_corp. Nhớ thêmcontrol = list(tokenize = tokenizer)để các thuật ngữ là bigram. - Tạo
amzn_p_tdm_mtừamzn_p_tdmbằng cách dùng hàmas.matrix(). - Tạo
amzn_p_freqđể lấy tần suất thuật ngữ từamzn_p_tdm_m. - Tạo một
wordcloud()dùngnames(amzn_p_freq)làm các từ,amzn_p_freqlàm tần suất tương ứng, và dùngmax.words = 25cùngcolor = "blue"cho phần hiển thị.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)