Lemmatisering med spaCy
I den här övningen får du träna på lemmatisering. Lemmatisering är användbart för att ta fram grundformen av härledda ord. Det innebär att antalet lemman i en mening alltid är mindre än eller lika med antalet tokens.
Den första Amazon-matrecensionen finns tillgänglig som en sträng med namnet text. en_core_web_sm är inläst som nlp och har körts på text för att skapa document, en Doc-behållare för textsträngen.
tokens, en lista med tokens för text, är också redan inläst och klar att använda.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Lägg till lemmat för samtliga tokens i
documentoch skriv sedan ut listanlemmas. - Skriv ut listan
tokensoch jämför skillnaderna mellantokensochlemmas.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)