НачатьНачать бесплатно

Приведение к нижнему регистру

Вы анализируете отзывы пользователей туристического сайта. В этих отзывах часто встречается непоследовательное использование регистра — например, "TRAVEL" и "travel". Чтобы подготовить текст к анализу тональности и извлечению тем, сначала приведите все слова к нижнему регистру, затем выполните токенизацию и удалите стоп-слова и знаки пунктуации.

Функция word_tokenize() и список stop_words уже предоставлены. Ресурсы NLTK загружены заранее.

Это упражнение является частью курса

Обработка естественного языка (NLP) на Python

Посмотреть курс

Инструкции к упражнению

  • Приведите переданный review к нижнему регистру.
  • Выполните токенизацию lower_text на отдельные слова.
  • С помощью спискового включения удалите стоп-слова и знаки пунктуации, используя списки stop_words и string.punctuation.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
Редактировать и запускать код