Loại bỏ dấu câu
Sau khi bạn đã loại bỏ stop words khỏi văn bản phản hồi, đã đến lúc xử lý dấu câu. Các token bạn thu được ở bài trước vẫn còn chứa ký tự dấu câu, vốn thường không cần thiết khi phân loại phản hồi.
Nhiệm vụ của bạn là loại bỏ dấu câu khỏi danh sách token được cung cấp, giúp làm sạch dữ liệu kỹ hơn nữa.
Bài tập này là một phần của khóa học
Natural Language Processing (NLP) bằng Python
Hướng dẫn bài tập
- Làm sạch danh sách
filtered_tokensbằng cách loại bỏ toàn bộ dấu câu.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
import string
filtered_tokens = ['reached', 'support', 'got', 'helpful', 'response', 'within', 'minutes', '!', '!', '!', '#', 'impressed']
# Remove punctuation
clean_tokens = [____ for word in filtered_tokens if ____ not in ____.____]
print(clean_tokens)