Lemmatizace pomocí spaCy
V tomto cvičení si procvičíš lemmatizaci. Lemmatizace se hodí k získání základního tvaru odvozených slov. To znamená, že pro libovolnou větu očekáváme, že počet lemat bude menší nebo roven počtu tokenů.
První recenze na potravinářský produkt z Amazonu je k dispozici jako řetězec text. en_core_web_sm je načtený jako nlp a byl spuštěn na proměnné text, čímž vznikl document – kontejner Doc pro daný textový řetězec.
tokens, seznam obsahující tokeny pro text, je také již připraven k použití.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Přidej lemma pro všechny tokeny v
documenta poté vypiš seznamlemmas. - Vypiš seznam
tokensa pozoruj rozdíly mezitokensalemmas.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)