Trực quan hóa các từ không giống nhau
Giả sử bạn muốn trực quan hóa các từ không trùng nhau. Bạn cũng có thể dùng comparison.cloud(), và các bước khá giống nhau, chỉ có một khác biệt chính.
Tương tự khi bạn tìm các từ chung, bạn bắt đầu bằng cách hợp nhất các tweet thành các corpora riêng biệt và kết hợp chúng vào một đối tượng VCorpus(). Tiếp theo áp dụng hàm clean_corpus() và tổ chức dữ liệu thành một TermDocumentMatrix.
Để theo dõi từ nào thuộc về coffee và từ nào thuộc về chardonnay, bạn có thể đặt tên cột của TDM như sau:
colnames(all_tdm) <- c("chardonnay", "coffee")
Cuối cùng, chuyển đối tượng sang ma trận bằng as.matrix() để dùng trong comparison.cloud(). Với mỗi corpus riêng biệt được truyền vào comparison.cloud(), bạn có thể chỉ định màu, như colors = c("red", "yellow", "green"), để các phần dễ phân biệt.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
all_corpus đã được nạp sẵn trong không gian làm việc của bạn.
- Tạo
all_cleanbằng cách áp dụng hàmclean_corpusđã định nghĩa trước choall_corpus. - Tạo
all_tdm, mộtTermDocumentMatrix, từall_clean. - Dùng
colnames()để đổi tên từng corpus trongall_tdm. Đặt tên cột thứ nhất là "coffee" và cột thứ hai là "chardonnay". - Tạo
all_mbằng cách chuyểnall_tdmsang dạng ma trận. - Tạo một
comparison.cloud()dùngall_m, vớicolors = c("orange", "blue")vàmax.words = 50.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)