ПочатиПочніть безкоштовно

Перетворення на нижній регістр

Ви аналізуєте відгуки користувачів для туристичного вебсайту. У цих відгуках часто трапляється непослідовне використання регістру, як-от "TRAVEL" і "travel". Щоб підготувати текст до аналізу тональності та виокремлення тем, спочатку перетворіть усі слова на нижній регістр, потім виконайте токенізацію та очистьте їх від стоп-слів і пунктуації.

Надано функцію word_tokenize() і список stop_words. Ресурси NLTK вже завантажено.

Ця вправа є частиною курсу

Natural Language Processing (NLP) in Python

Переглянути курс

Інструкції до вправи

  • Перетворіть змінну review на нижній регістр.
  • Розбийте lower_text на токени-слова.
  • Використайте спискове включення, щоб вилучити стоп-слова та пунктуацію, застосувавши списки stop_words і string.punctuation.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
Редагувати та запускати код