Khám phá một corpus trong R
Một đồng nghiệp đã chuẩn bị một corpus gồm 20 tài liệu bàn về dầu thô, đặt tên là crude. Đây chỉ là mẫu trong số vài nghìn bài viết bạn sẽ nhận vào tuần tới. Để sẵn sàng chạy phân tích văn bản trên các tài liệu này, bạn quyết định khám phá nội dung và siêu dữ liệu của chúng. Hãy nhớ rằng trong R, một VCorpus chứa cả meta và content cho mỗi văn bản. Trong bài học này, bạn sẽ khám phá hai đối tượng đó.
Bài tập này là một phần của khóa học
Nhập môn Xử lý Ngôn ngữ Tự nhiên với R
Hướng dẫn bài tập
- In ra
crudevà xem kết quả. - In nội dung của bài viết thứ 10.
- In ID của bài viết đầu tiên trong
crude. - Dùng vòng lặp for đã cho để tạo một vector các ID từ corpus.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}