Вилучення стоп-слів
Ви працюєте над проєктом, де потрібно класифікувати відгуки користувачів за категоріями, як-от «проблеми з продуктом», «проблеми із сервісом» та «пропозиції». Часто стоп-слова не допомагають відрізнити категорії за змістом. Ваше завдання — вилучити ці стоп-слова, щоб зосередитися на важливих словах, які згодом допоможуть моделі правильно віднести відгук до теми.
Функції word_tokenize з nltk.tokenize і stopwords.words з nltk.corpus вже імпортовано для вас. Крім того, ресурси NLTK punkt_tab і stopwords уже завантажено.
Ця вправа є частиною курсу
Natural Language Processing (NLP) in Python
Інструкції до вправи
- Виконайте токенізацію наведеного відгуку на слова.
- Отримайте список англійських стоп-слів.
- Вилучіть англійські стоп-слова та збережіть результат у
filtered_tokens.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)