Ôn nhanh TM (I)
Trong khóa học Text Mining: Bag of Words, bạn đã học rằng một corpus là một tập hợp văn bản, và bạn đã tìm hiểu một số hàm để tiền xử lý văn bản. Tóm lược lại, một cách để tạo và làm sạch corpus là dùng các hàm dưới đây. Dù đây là một khóa học khác, phân tích cảm xúc vẫn thuộc text mining nên phần ôn tập này sẽ hữu ích.
- Chuyển một vector ký tự thành nguồn văn bản bằng
VectorSource(). - Chuyển nguồn văn bản thành corpus bằng
VCorpus(). - Loại bỏ các ký tự không mong muốn khỏi corpus bằng các hàm làm sạch như
removePunctuation()vàstripWhitespace()từtm, vàreplace_abbreviation()từqdap.
Trong bài tập này, một hàm tùy chỉnh clean_corpus() đã được tạo từ các hàm tiền xử lý chuẩn để dễ áp dụng hơn.
clean_corpus() nhận đầu ra của VCorpus() và áp dụng các hàm làm sạch. Ví dụ:
processed_corpus <- clean_corpus(my_corpus)
Bài tập này là một phần của khóa học
Phân tích cảm xúc trong R
Hướng dẫn bài tập
Phiên R của bạn có một vector văn bản, tm_define, gồm hai tài liệu nhỏ và hàm clean_corpus().
- Tạo đối tượng tên
tm_vectorbằng cách áp dụngVectorSource()lêntm_define. - Tạo
tm_corpusbằngVCorpus()trêntm_vector. - Dùng
content()để xem nội dung của tài liệu đầu tiên trongtm_corpus.- Truy cập tài liệu trong corpus bằng cú pháp danh sách, nên dùng cặp ngoặc vuông kép, ví dụ
[[1]].
- Truy cập tài liệu trong corpus bằng cú pháp danh sách, nên dùng cặp ngoặc vuông kép, ví dụ
- Làm sạch văn bản của corpus bằng hàm tùy chỉnh
clean_corpus()trêntm_corpus. Đặt đối tượng mới này làtm_clean. - Xem lại tài liệu đầu tiên của đối tượng
tm_cleanmới để thấy văn bản đã thay đổi thế nào sau khi áp dụngclean_corpus().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___