Bắt đầu ngayBắt đầu miễn phí

Tất tần tật về stop words

Thường có những từ xuất hiện rất nhiều nhưng mang lại ít thông tin. Chúng được gọi là stop words (từ dừng), và bạn có thể muốn loại chúng khỏi phân tích. Một số stop words phổ biến trong tiếng Anh gồm "I", "she'll", "the", v.v. Trong gói tm, có 174 stop words tiếng Anh phổ biến (bạn sẽ in ra trong bài này!)

Khi phân tích, bạn thường sẽ cần bổ sung thêm vào danh sách này. Với ví dụ tweet về cà phê, mọi tweet đều chứa "coffee", nên quan trọng là phải loại cả từ đó bên cạnh các stop words phổ biến. Giữ lại "coffee" không mang thêm insight nào và sẽ khiến từ này bị nhấn quá mạnh trong phân tích tần suất.

Dùng hàm c() cho phép bạn thêm từ mới vào danh sách stop words. Ví dụ, đoạn sau sẽ thêm "word1" và "word2" vào danh sách stop words tiếng Anh mặc định:

all_stops <- c("word1", "word2", stopwords("en"))

Khi đã có danh sách stop words hợp lý, bạn sẽ dùng hàm removeWords() trên văn bản của mình. removeWords() nhận hai đối số: đối tượng text cần áp dụng và danh sách các từ cần loại bỏ.

Bài tập này là một phần của khóa học

Khai phá văn bản với Bag-of-Words trong R

Xem khóa học

Hướng dẫn bài tập

  • Xem lại các stop words chuẩn bằng cách gọi stopwords("en").
  • Loại bỏ stop words "en" khỏi text.
  • Thêm "coffee" và "bean" vào stop words chuẩn, gán vào new_stops.
  • Loại bỏ stop words tùy chỉnh new_stops khỏi text.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

## text is preloaded into your workspace

# List standard English stop words
___

# Print text without standard stop words
removeWords(___, ___("___"))

# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)

# Remove stop words from text
___
Chỉnh sửa và Chạy Mã