Bắt đầu ngayBắt đầu miễn phí

Khám phá một corpus trong R

Một đồng nghiệp đã chuẩn bị một corpus gồm 20 tài liệu bàn về dầu thô, đặt tên là crude. Đây chỉ là mẫu trong số vài nghìn bài viết bạn sẽ nhận vào tuần tới. Để sẵn sàng chạy phân tích văn bản trên các tài liệu này, bạn quyết định khám phá nội dung và siêu dữ liệu của chúng. Hãy nhớ rằng trong R, một VCorpus chứa cả metacontent cho mỗi văn bản. Trong bài học này, bạn sẽ khám phá hai đối tượng đó.

Bài tập này là một phần của khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Xem khóa học

Hướng dẫn bài tập

  • In ra crude và xem kết quả.
  • In nội dung của bài viết thứ 10.
  • In ID của bài viết đầu tiên trong crude.
  • Dùng vòng lặp for đã cho để tạo một vector các ID từ corpus.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Print out the corpus
print(___)

# Print the content of the 10th article
crude[[___]]$___

# Find the first ID
crude[[___]]$___$id

# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
  ids <- append(ids, crude[[___]]$___$id)
}
Chỉnh sửa và Chạy Mã