Zacznij terazZacznij za darmo

Lematyzacja w spaCy

W tym ćwiczeniu przećwiczysz lematyzację. Lematyzacja pomaga wyznaczać formę podstawową słów pochodnych. Oznacza to, że dla dowolnego zdania liczba lematów jest mniejsza lub równa liczbie tokenów.

Pierwsza recenzja produktu spożywczego z Amazona jest dostępna w zmiennej text. Model en_core_web_sm jest załadowany jako nlp i został już uruchomiony na zmiennej text, tworząc document – kontener Doc dla tego tekstu.

Lista tokens zawierająca tokeny dla text jest również już załadowana i gotowa do użycia.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Dodaj lematę każdego tokenu z document do listy, a następnie wydrukuj listę lemmas.
  • Wydrukuj listę tokens i porównaj różnice między tokens a lemmas.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Edytuj i uruchom kod