Các hàm làm sạch phổ biến từ tm
Giờ bạn đã biết hai cách tạo một corpus, hãy tập trung vào việc làm sạch, hay tiền xử lý, văn bản. Trước hết, bạn sẽ làm sạch một đoạn văn bản nhỏ; sau đó chuyển sang các corpus lớn hơn.
Trong khai phá văn bản theo phương pháp bag-of-words, việc làm sạch giúp gom nhóm các thuật ngữ. Ví dụ, có thể hợp lý khi coi "miner", "mining" và "mine" là cùng một thuật ngữ. Các bước tiền xử lý cụ thể sẽ khác nhau tùy dự án. Chẳng hạn, từ ngữ trong tweet rất khác so với trong tài liệu pháp lý, nên quy trình làm sạch cũng có thể rất khác.
Một số hàm tiền xử lý phổ biến gồm:
tolower(): Chuyển tất cả ký tự thành chữ thườngremovePunctuation(): Xóa mọi dấu câuremoveNumbers(): Xóa chữ sốstripWhitespace(): Xóa khoảng trắng thừa
tolower() thuộc base R, còn ba hàm còn lại đến từ gói tm. Trong phần tiếp theo, chúng tôi sẽ nạp tm và qdap cho bạn khi cần. Mỗi khi giới thiệu một gói mới, lần đầu tiên chúng tôi sẽ yêu cầu bạn tự nạp gói đó.
Biến text, chứa một câu, đã có sẵn trong script.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
Áp dụng từng hàm sau lên text và chỉ in kết quả ra console:
- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create the object: text
text <- "She woke up at 6 A.M. It\'s so early! She was only 10% awake and began drinking coffee in front of her computer."
# Make lowercase
___
# Remove punctuation
____
# Remove numbers
___
# Remove whitespace
___