開始使用免費開始

使用 spaCy 進行詞形還原(Lemmatization)

在這個練習中,你會練習詞形還原(lemmatization)。詞形還原能幫助你把衍生字還原成詞根形式。也就是說,對任一句子而言,詞形還原後的詞數應該小於或等於 token 的數量。

第一則 Amazon 食品評論已存成字串 texten_core_web_sm 已以 nlp 載入,並已套用到 text 以建立 document,也就是此文字字串的 Doc 容器。

tokens(一個包含 text 中各個 token 的清單)也已經為你載入,可以直接使用。

本練習屬於課程

使用 spaCy 的自然語言處理

檢視課程

練習說明

  • document 中所有 token 的詞形還原結果加入 lemmas,然後列印 lemmas 清單。
  • 列印 tokens 清單,並觀察 tokenslemmas 的差異。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
編輯並執行程式碼