Bắt đầu ngayBắt đầu miễn phí

Tạo một tibble từ một corpus

Để khám phá sâu hơn corpus về dữ liệu dầu thô mà bạn nhận từ đồng nghiệp, bạn quyết định tạo một pipeline để làm sạch văn bản trong các tài liệu. Thay vì tìm hiểu cách làm việc này với gói tm, bạn chọn chuyển đổi corpus thành một tibble để có thể dùng các hàm unnest_tokens(), count(), và anti_join() mà bạn đã quen thuộc. Corpus crude chứa cả metadata và văn bản của từng tài liệu.

Bài tập này là một phần của khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Xem khóa học

Hướng dẫn bài tập

  • Chuyển corpus thành một tibble.
  • Dùng names để in ra tên các cột.
  • Tách token (theo từ), đếm, và loại bỏ stop words từ cột text của crude_tibble.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Chỉnh sửa và Chạy Mã