Biến vector thành đối tượng VCorpus (2)
Giờ bạn đã chuyển vector thành một đối tượng Source, chúng ta sẽ truyền nó vào hàm khác của tm, VCorpus(), để tạo một corpus volatile. Khá đơn giản, đúng không?
Đối tượng VCorpus là một list lồng nhau (list của các list). Ở mỗi vị trí trong VCorpus, có một đối tượng PlainTextDocument, là một list chứa dữ liệu văn bản thực sự (content) và một số siêu dữ liệu tương ứng (meta). Bạn có thể hình dung đối tượng VCorpus để dễ hình dung tổng thể.
Để xem một đối tượng tài liệu đơn lẻ (tài liệu thứ 10), bạn lấy phần tử bằng ngoặc vuông kép.
coffee_corpus[[10]]
Để xem phần văn bản thực sự, bạn đánh chỉ mục list hai lần. Để truy cập siêu dữ liệu của tài liệu, như timestamp, hãy đổi [1] thành [2]. Cách khác để xem văn bản thuần là dùng hàm content(), hàm này không cần cặp ngoặc vuông thứ hai.
coffee_corpus[[10]][1]
content(coffee_corpus[[10]])
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Gọi hàm
VCorpus()trên đối tượngcoffee_sourceđể tạocoffee_corpus. - Xác minh
coffee_corpuslà đối tượngVCorpusbằng cách in nó ra console. - In phần tử thứ 15 của
coffee_corpusra console để kiểm tra đó làPlainTextDocumentchứa nội dung và siêu dữ liệu của tweet thứ 15. Dùng truy xuất bằng ngoặc vuông kép. - In nội dung của tweet thứ 15 trong
coffee_corpus. Dùng ngoặc vuông kép để chọn đúng tweet, sau đó dùng ngoặc vuông đơn để trích xuất nội dung của tweet đó. - In
content()của tweet thứ 10 trongcoffee_corpus
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
## coffee_source is already in your workspace
# Make a volatile corpus from coffee_source
coffee_corpus <- ___
# Print out coffee_corpus
___
# Print the 15th tweet in coffee_corpus
___
# Print the contents of the 15th tweet in coffee_corpus
___
# Now use content to review the plain text of the 10th tweet
___(___[[___]])