使用 spaCy 進行詞形還原(Lemmatization)
在這個練習中,你會練習詞形還原(lemmatization)。詞形還原能幫助你把衍生字還原成詞根形式。也就是說,對任一句子而言,詞形還原後的詞數應該小於或等於 token 的數量。
第一則 Amazon 食品評論已存成字串 text。en_core_web_sm 已以 nlp 載入,並已套用到 text 以建立 document,也就是此文字字串的 Doc 容器。
tokens(一個包含 text 中各個 token 的清單)也已經為你載入,可以直接使用。
本練習屬於課程
使用 spaCy 的自然語言處理
練習說明
- 將
document中所有 token 的詞形還原結果加入lemmas,然後列印lemmas清單。 - 列印
tokens清單,並觀察tokens與lemmas的差異。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)