Usuwanie stopwords
Pracujesz nad projektem, którego celem jest klasyfikowanie opinii użytkowników do różnych kategorii, takich jak „problemy z produktem", „problemy z obsługą" czy „sugestie". Stopwords zazwyczaj nie pomagają w odróżnianiu kategorii od siebie. Twoim zadaniem jest usunięcie tych słów, aby skupić się na tych, które pozwolą modelowi poprawnie przypisać opinię do odpowiedniego tematu.
Funkcje word_tokenize z nltk.tokenize oraz stopwords.words z nltk.corpus zostały już zaimportowane. Zasoby NLTK punkt_tab i stopwords są również dostępne.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego (NLP) w Pythonie
Instrukcje do ćwiczenia
- Podziel podaną opinię na tokeny (słowa).
- Pobierz listę angielskich stopwords.
- Usuń angielskie stopwords i zapisz wynik w
filtered_tokens.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)