Zacznij terazZacznij za darmo

Stemming

Tekst review jest już wyczyszczony – usunięto stop słowa i znaki interpunkcyjne. Teraz czas na normalizację pozostałych słów za pomocą stemmingu, który sprowadza wyrazy do ich formy rdzennej. Dzięki temu podobne słowa są grupowane razem, co sprawia, że analiza jest spójniejsza i bardziej efektywna.

Do dyspozycji masz klasę PorterStemmer oraz listę clean_tokens.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego (NLP) w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zainicjalizuj PorterStemmer().
  • Użyj wyrażenia listowego, aby zastosować stemming do każdego tokenu z listy clean_tokens.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create stemmer
stemmer = ____()

# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]

print(stemmed_tokens)
Edytuj i uruchom kod