Перетворення на нижній регістр
Ви аналізуєте відгуки користувачів для туристичного вебсайту. У цих відгуках часто трапляється непослідовне використання регістру, як-от "TRAVEL" і "travel". Щоб підготувати текст до аналізу тональності та виокремлення тем, спочатку перетворіть усі слова на нижній регістр, потім виконайте токенізацію та очистьте їх від стоп-слів і пунктуації.
Надано функцію word_tokenize() і список stop_words. Ресурси NLTK вже завантажено.
Ця вправа є частиною курсу
Natural Language Processing (NLP) in Python
Інструкції до вправи
- Перетворіть змінну
reviewна нижній регістр. - Розбийте
lower_textна токени-слова. - Використайте спискове включення, щоб вилучити стоп-слова та пунктуацію, застосувавши списки
stop_wordsіstring.punctuation.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"
# Lowercase the review
lower_text = ____
# Tokenize the lower_text into words
tokens = ____
# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]
print(clean_tokens)