Bắt đầu ngayBắt đầu miễn phí

Trích xuất đặc trưng & phân tích: amzn_cons

Giờ bạn quyết định so sánh với kho văn bản amzn_cons_corp trong một TDM bigram khác. Tất nhiên, bạn kỳ vọng sẽ thấy một số cụm từ khác trong đám mây từ.

Một lần nữa, bạn sẽ dùng hàm tùy chỉnh này để trích xuất các đặc trưng bigram cho trực quan hóa:

tokenizer <- function(x) 
  NGramTokenizer(x, Weka_control(min = 2, max = 2))

Bài tập này là một phần của khóa học

Khai phá văn bản với Bag-of-Words trong R

Xem khóa học

Hướng dẫn bài tập

  • Tạo amzn_c_tdm bằng cách chuyển amzn_cons_corp thành TermDocumentMatrix và thêm hàm bigram control = list(tokenize = tokenizer).
  • Tạo amzn_c_tdm_m là phiên bản ma trận của amzn_c_tdm.
  • Tạo amzn_c_freq bằng cách dùng rowSums() để lấy tần suất thuật ngữ từ amzn_c_tdm_m.
  • Tạo một wordcloud() sử dụng names(amzn_c_freq) và các giá trị amzn_c_freq. Đồng thời dùng các đối số max.words = 25color = "red".

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_c_tdm_m
___ <- ___

# Create amzn_c_freq
___ <- ___

# Plot a word cloud of negative Amazon bigrams
___
Chỉnh sửa và Chạy Mã