НачатьНачать бесплатно

Удаление стоп-слов

Вы работаете над проектом, цель которого — классифицировать отзывы пользователей по категориям: «проблемы с продуктом», «проблемы с сервисом» и «предложения». Стоп-слова, как правило, не несут смысловой нагрузки при разграничении категорий. Ваша задача — удалить их, чтобы сосредоточиться на значимых словах, которые помогут модели в дальнейшем корректно распределить отзывы по темам.

Функции word_tokenize из nltk.tokenize и stopwords.words из nltk.corpus уже импортированы. Ресурсы NLTK punkt_tab и stopwords также загружены заранее.

Это упражнение является частью курса

Обработка естественного языка (NLP) на Python

Посмотреть курс

Инструкции к упражнению

  • Выполните токенизацию предоставленного отзыва по словам.
  • Получите список английских стоп-слов.
  • Удалите английские стоп-слова и сохраните результат в filtered_tokens.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
Редактировать и запускать код