Chuyển về chữ thường
Bạn đang phân tích đánh giá của người dùng cho một trang web du lịch. Những đánh giá này thường có cách viết hoa không nhất quán như "TRAVEL" và "travel". Để chuẩn bị văn bản cho phân tích cảm xúc và trích xuất chủ đề, trước tiên bạn sẽ chuyển tất cả từ về chữ thường, sau đó tách từ (tokenize) và làm sạch bằng cách loại bỏ stop words và dấu câu.
Hàm word_tokenize(), danh sách stop_words đã được cung cấp. Tài nguyên NLTK đã được tải xuống sẵn.
Bài tập này là một phần của khóa học
Natural Language Processing (NLP) bằng Python
Hướng dẫn bài tập
- Chuyển
reviewđã cho về chữ thường. - Tách từ
lower_textthành các token. - Dùng list comprehension để loại bỏ stop words và dấu câu bằng các danh sách
stop_wordsvàstring.punctuation.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"
# Lowercase the review
lower_text = ____
# Tokenize the lower_text into words
tokens = ____
# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]
print(clean_tokens)