Stemming
Nu när du har rensat texten i review och tagit bort stoppord och skiljetecken är du redo att normalisera de kvarvarande orden med stemming – en teknik som reducerar ord till deras grundform. Det gör att liknande ord grupperas ihop, vilket ger en mer konsekvent och effektiv analys.
Klassen PorterStemmer har redan importerats, tillsammans med en lista med clean_tokens.
Den här övningen är en del av kursen
Natural Language Processing (NLP) i Python
Övningsinstruktioner
- Initiera
PorterStemmer(). - Använd en listomfattning för att utföra stemming på varje token i listan
clean_tokens.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)