Začněte nyníZačněte zdarma

Lemmatizace pomocí spaCy

V tomto cvičení si procvičíš lemmatizaci. Lemmatizace se hodí k získání základního tvaru odvozených slov. To znamená, že pro libovolnou větu očekáváme, že počet lemat bude menší nebo roven počtu tokenů.

První recenze na potravinářský produkt z Amazonu je k dispozici jako řetězec text. en_core_web_sm je načtený jako nlp a byl spuštěn na proměnné text, čímž vznikl document – kontejner Doc pro daný textový řetězec.

tokens, seznam obsahující tokeny pro text, je také již připraven k použití.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Přidej lemma pro všechny tokeny v document a poté vypiš seznam lemmas.
  • Vypiš seznam tokens a pozoruj rozdíly mezi tokens a lemmas.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Upravit a spustit kód