Lematyzacja w spaCy
W tym ćwiczeniu przećwiczysz lematyzację. Lematyzacja pomaga wyznaczać formę podstawową słów pochodnych. Oznacza to, że dla dowolnego zdania liczba lematów jest mniejsza lub równa liczbie tokenów.
Pierwsza recenzja produktu spożywczego z Amazona jest dostępna w zmiennej text. Model en_core_web_sm jest załadowany jako nlp i został już uruchomiony na zmiennej text, tworząc document – kontener Doc dla tego tekstu.
Lista tokens zawierająca tokeny dla text jest również już załadowana i gotowa do użycia.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Dodaj lematę każdego tokenu z
documentdo listy, a następnie wydrukuj listęlemmas. - Wydrukuj listę
tokensi porównaj różnice międzytokensalemmas.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)