Trích xuất đặc trưng & phân tích: amzn_cons
Giờ bạn quyết định so sánh với kho văn bản amzn_cons_corp trong một TDM bigram khác. Tất nhiên, bạn kỳ vọng sẽ thấy một số cụm từ khác trong đám mây từ.
Một lần nữa, bạn sẽ dùng hàm tùy chỉnh này để trích xuất các đặc trưng bigram cho trực quan hóa:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Tạo
amzn_c_tdmbằng cách chuyểnamzn_cons_corpthànhTermDocumentMatrixvà thêm hàm bigramcontrol = list(tokenize = tokenizer). - Tạo
amzn_c_tdm_mlà phiên bản ma trận củaamzn_c_tdm. - Tạo
amzn_c_freqbằng cách dùngrowSums()để lấy tần suất thuật ngữ từamzn_c_tdm_m. - Tạo một
wordcloud()sử dụngnames(amzn_c_freq)và các giá trịamzn_c_freq. Đồng thời dùng các đối sốmax.words = 25vàcolor = "red".
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___