Удаление стоп-слов
Вы работаете над проектом, цель которого — классифицировать отзывы пользователей по категориям: «проблемы с продуктом», «проблемы с сервисом» и «предложения». Стоп-слова, как правило, не несут смысловой нагрузки при разграничении категорий. Ваша задача — удалить их, чтобы сосредоточиться на значимых словах, которые помогут модели в дальнейшем корректно распределить отзывы по темам.
Функции word_tokenize из nltk.tokenize и stopwords.words из nltk.corpus уже импортированы. Ресурсы NLTK punkt_tab и stopwords также загружены заранее.
Это упражнение является частью курса
Обработка естественного языка (NLP) на Python
Инструкции к упражнению
- Выполните токенизацию предоставленного отзыва по словам.
- Получите список английских стоп-слов.
- Удалите английские стоп-слова и сохраните результат в
filtered_tokens.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)