Zacznij terazZacznij za darmo

Usuwanie stopwords

Pracujesz nad projektem, którego celem jest klasyfikowanie opinii użytkowników do różnych kategorii, takich jak „problemy z produktem", „problemy z obsługą" czy „sugestie". Stopwords zazwyczaj nie pomagają w odróżnianiu kategorii od siebie. Twoim zadaniem jest usunięcie tych słów, aby skupić się na tych, które pozwolą modelowi poprawnie przypisać opinię do odpowiedniego tematu.

Funkcje word_tokenize z nltk.tokenize oraz stopwords.words z nltk.corpus zostały już zaimportowane. Zasoby NLTK punkt_tab i stopwords są również dostępne.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego (NLP) w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Podziel podaną opinię na tokeny (słowa).
  • Pobierz listę angielskich stopwords.
  • Usuń angielskie stopwords i zapisz wynik w filtered_tokens.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
Edytuj i uruchom kod