Bắt đầu ngayBắt đầu miễn phí

Trực quan hóa các từ không giống nhau

Giả sử bạn muốn trực quan hóa các từ không trùng nhau. Bạn cũng có thể dùng comparison.cloud(), và các bước khá giống nhau, chỉ có một khác biệt chính.

Tương tự khi bạn tìm các từ chung, bạn bắt đầu bằng cách hợp nhất các tweet thành các corpora riêng biệt và kết hợp chúng vào một đối tượng VCorpus(). Tiếp theo áp dụng hàm clean_corpus() và tổ chức dữ liệu thành một TermDocumentMatrix.

Để theo dõi từ nào thuộc về coffee và từ nào thuộc về chardonnay, bạn có thể đặt tên cột của TDM như sau:

colnames(all_tdm) <- c("chardonnay", "coffee")

Cuối cùng, chuyển đối tượng sang ma trận bằng as.matrix() để dùng trong comparison.cloud(). Với mỗi corpus riêng biệt được truyền vào comparison.cloud(), bạn có thể chỉ định màu, như colors = c("red", "yellow", "green"), để các phần dễ phân biệt.

Bài tập này là một phần của khóa học

Khai phá văn bản với Bag-of-Words trong R

Xem khóa học

Hướng dẫn bài tập

all_corpus đã được nạp sẵn trong không gian làm việc của bạn.

  • Tạo all_clean bằng cách áp dụng hàm clean_corpus đã định nghĩa trước cho all_corpus.
  • Tạo all_tdm, một TermDocumentMatrix, từ all_clean.
  • Dùng colnames() để đổi tên từng corpus trong all_tdm. Đặt tên cột thứ nhất là "coffee" và cột thứ hai là "chardonnay".
  • Tạo all_m bằng cách chuyển all_tdm sang dạng ma trận.
  • Tạo một comparison.cloud() dùng all_m, với colors = c("orange", "blue")max.words = 50.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Clean the corpus
___ <- ___(___)

# Create all_tdm
___ <- ___(___)

# Give the columns distinct names
___(___) <- ___

# Create all_m
___ <- ___(___)

# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)
Chỉnh sửa và Chạy Mã