Tạo một tibble từ một corpus
Để khám phá sâu hơn corpus về dữ liệu dầu thô mà bạn nhận từ đồng nghiệp, bạn quyết định tạo một pipeline để làm sạch văn bản trong các tài liệu. Thay vì tìm hiểu cách làm việc này với gói tm, bạn chọn chuyển đổi corpus thành một tibble để có thể dùng các hàm unnest_tokens(), count(), và anti_join() mà bạn đã quen thuộc. Corpus crude chứa cả metadata và văn bản của từng tài liệu.
Bài tập này là một phần của khóa học
Nhập môn Xử lý Ngôn ngữ Tự nhiên với R
Hướng dẫn bài tập
- Chuyển corpus thành một tibble.
- Dùng
namesđể in ra tên các cột. - Tách token (theo từ), đếm, và loại bỏ stop words từ cột
textcủacrude_tibble.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)