Kom igångKom igång gratis

Ta bort stoppord

Du arbetar med ett projekt där målet är att klassificera feedback från användare i olika kategorier, som "produktproblem", "serviceproblem" och "förslag". Stoppord bidrar sällan till att skilja kategorier åt. Din uppgift är att ta bort dessa stoppord för att fokusera på de ord som senare hjälper en modell att placera feedbacken i rätt kategori.

Funktionerna word_tokenize från nltk.tokenize och stopwords.words från nltk.corpus har redan importerats. Dessutom har NLTK-resurserna punkt_tab och stopwords redan laddats ned.

Den här övningen är en del av kursen

Natural Language Processing (NLP) i Python

Visa kurs

Övningsinstruktioner

  • Tokenisera den angivna feedbacken till ord.
  • Hämta listan med engelska stoppord.
  • Ta bort de engelska stopporden och spara resultatet i filtered_tokens.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
Redigera och kör kod