Kom igångKom igång gratis

Stemming

Nu när du har rensat texten i review och tagit bort stoppord och skiljetecken är du redo att normalisera de kvarvarande orden med stemming – en teknik som reducerar ord till deras grundform. Det gör att liknande ord grupperas ihop, vilket ger en mer konsekvent och effektiv analys.

Klassen PorterStemmer har redan importerats, tillsammans med en lista med clean_tokens.

Den här övningen är en del av kursen

Natural Language Processing (NLP) i Python

Visa kurs

Övningsinstruktioner

  • Initiera PorterStemmer().
  • Använd en listomfattning för att utföra stemming på varje token i listan clean_tokens.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create stemmer
stemmer = ____()

# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]

print(stemmed_tokens)
Redigera och kör kod