Loại bỏ stop words
Bạn đang thực hiện một dự án nhằm phân loại phản hồi của người dùng vào các nhóm như "product issues", "service issues" và "suggestions". Thông thường, stop words không mang nhiều ý nghĩa để phân biệt giữa các nhóm. Nhiệm vụ của bạn là loại bỏ các stop words để tập trung vào những từ quan trọng, giúp mô hình sau này phân loại phản hồi vào đúng chủ đề.
Các hàm word_tokenize từ nltk.tokenize và stopwords.words từ nltk.corpus đã được nhập sẵn cho bạn. Ngoài ra, tài nguyên NLTK punkt_tab và stopwords cũng đã được tải xuống trước.
Bài tập này là một phần của khóa học
Natural Language Processing (NLP) bằng Python
Hướng dẫn bài tập
- Tách từ cho đoạn phản hồi đã cho.
- Lấy danh sách stop words tiếng Anh.
- Loại bỏ stop words tiếng Anh và lưu kết quả vào
filtered_tokens.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)