Stemming
Tekst review jest już wyczyszczony – usunięto stop słowa i znaki interpunkcyjne. Teraz czas na normalizację pozostałych słów za pomocą stemmingu, który sprowadza wyrazy do ich formy rdzennej. Dzięki temu podobne słowa są grupowane razem, co sprawia, że analiza jest spójniejsza i bardziej efektywna.
Do dyspozycji masz klasę PorterStemmer oraz listę clean_tokens.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego (NLP) w Pythonie
Instrukcje do ćwiczenia
- Zainicjalizuj
PorterStemmer(). - Użyj wyrażenia listowego, aby zastosować stemming do każdego tokenu z listy
clean_tokens.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)