Bắt đầu ngayBắt đầu miễn phí

Loại bỏ stop words

Bạn đang thực hiện một dự án nhằm phân loại phản hồi của người dùng vào các nhóm như "product issues", "service issues" và "suggestions". Thông thường, stop words không mang nhiều ý nghĩa để phân biệt giữa các nhóm. Nhiệm vụ của bạn là loại bỏ các stop words để tập trung vào những từ quan trọng, giúp mô hình sau này phân loại phản hồi vào đúng chủ đề.

Các hàm word_tokenize từ nltk.tokenizestopwords.words từ nltk.corpus đã được nhập sẵn cho bạn. Ngoài ra, tài nguyên NLTK punkt_tabstopwords cũng đã được tải xuống trước.

Bài tập này là một phần của khóa học

Natural Language Processing (NLP) bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tách từ cho đoạn phản hồi đã cho.
  • Lấy danh sách stop words tiếng Anh.
  • Loại bỏ stop words tiếng Anh và lưu kết quả vào filtered_tokens.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
Chỉnh sửa và Chạy Mã