Tìm từ chung
Giả sử bạn muốn trực quan hóa các từ xuất hiện chung giữa nhiều tài liệu. Bạn có thể làm điều này với commonality.cloud().
Mỗi kho dữ liệu coffee và chardonnay của chúng ta gồm nhiều tweet riêng lẻ. Để xử lý toàn bộ tweet về coffee như một tài liệu đơn lẻ và tương tự cho chardonnay, bạn paste() tất cả tweet trong mỗi kho cùng với tham số collapse = " ". Cách này gộp tất cả tweet (ngăn cách bằng một dấu cách) thành một vector đơn. Sau đó, bạn có thể tạo một vector đơn chứa hai tài liệu đã gộp.
a_single_string <- paste(a_character_vector, collapse = " ")
Khi hoàn tất các bước này, bạn có thể áp dụng cùng cách làm như trước để tạo VCorpus() dựa trên VectorSource từ đối tượng all_tweets.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Tạo
all_coffeebằng cách dùngpaste()vớicollapse = " "trêncoffee_tweets$text. - Tạo
all_chardonnaybằng cách dùngpaste()vớicollapse = " "trênchardonnay_tweets$text. - Tạo
all_tweetsbằng cách dùngc()để kết hợpall_coffeevàall_chardonnay. Đặtall_coffeelà phần tử đầu tiên. - Chuyển đổi
all_tweetsbằngVectorSource(). - Tạo
all_corpusbằng cách dùngVCorpus()trênall_tweets.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create all_coffee
___ <- ___(___, ___)
# Create all_chardonnay
___ <- ___(___, ___)
# Create all_tweets
___ <- ___(___, ___)
# Convert to a vector source
___ <- ___(___)
# Create all_corpus
___ <- ___(___)