ÎncepețiÎncepe gratuit

Lematizare cu spaCy

În acest exercițiu vei exersa lematizarea. Lematizarea este utilă pentru a obține forma de bază a cuvintelor derivate. Aceasta înseamnă că, pentru orice propoziție, numărul de leme va fi mai mic sau egal cu numărul de tokeni.

Prima recenzie Amazon pentru produse alimentare îți este furnizată ca șir de caractere în variabila text. en_core_web_sm este încărcat ca nlp și a fost aplicat pe text pentru a compila document, un container Doc pentru șirul de text.

tokens, o listă care conține tokenii din text, este de asemenea deja disponibilă pentru utilizare.

Acest exercițiu face parte din cursul

Procesarea limbajului natural cu spaCy

Vezi cursul

Instrucțiuni pentru exercițiu

  • Adaugă lema pentru toți tokenii din document, apoi afișează lista lemmas.
  • Afișează lista tokens și observă diferențele dintre tokens și lemmas.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Editează și rulează codul