Kom igångKom igång gratis

Lemmatisering med spaCy

I den här övningen får du träna på lemmatisering. Lemmatisering är användbart för att ta fram grundformen av härledda ord. Det innebär att antalet lemman i en mening alltid är mindre än eller lika med antalet tokens.

Den första Amazon-matrecensionen finns tillgänglig som en sträng med namnet text. en_core_web_sm är inläst som nlp och har körts på text för att skapa document, en Doc-behållare för textsträngen.

tokens, en lista med tokens för text, är också redan inläst och klar att använda.

Den här övningen är en del av kursen

Naturlig språkbehandling med spaCy

Visa kurs

Övningsinstruktioner

  • Lägg till lemmat för samtliga tokens i document och skriv sedan ut listan lemmas.
  • Skriv ut listan tokens och jämför skillnaderna mellan tokens och lemmas.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
Redigera och kör kod