Zacznij terazZacznij za darmo

Ćwiczenie z preprocessingu tekstu

Czas zastosować poznane techniki w praktyce – oczyścisz tekst, by uzyskać lepsze wyniki analizy NLP. Usuń stop słowa i znaki niebędące literami, przeprowadź lematyzację, a następnie utwórz nowy model bag-of-words na oczyszczonym tekście.

Punktm wyjścia są tokeny lower_tokens utworzone w poprzednim ćwiczeniu. Klasa Counter jest już zaimportowana.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę WordNetLemmatizer z nltk.stem.
  • Utwórz listę alpha_only zawierającą wyłącznie znaki alfabetyczne. Użyj metody .isalpha(), aby to sprawdzić.
  • Utwórz kolejną listę no_stops złożoną ze słów z alpha_only, które nie występują w english_stops.
  • Utwórz obiekt WordNetLemmatizer o nazwie wordnet_lemmatizer i użyj jego metody .lemmatize() na tokenach z no_stops, aby uzyskać nową listę lemmatized.
  • Utwórz nowy obiekt Counter o nazwie bow na podstawie zlematyzowanych słów.
  • Na końcu wyświetl 10 najczęściej występujących tokenów.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import WordNetLemmatizer
____

# Retain alphabetic words: alpha_only
alpha_only = [t for t in ____ if ____]

# Remove all stop words: no_stops
no_stops = [t for t in ____ if t not in ____]

# Instantiate the WordNetLemmatizer
wordnet_lemmatizer = ____

# Lemmatize all tokens into a new list: lemmatized
lemmatized = [____ for t in ____]

# Create the bag-of-words: bow
bow = ____(____)

# Print the 10 most common tokens
print(____.____(__))
Edytuj i uruchom kod