為蓋茨堡演說進行斷詞(Tokenization)
在這個練習中,你會針對史上最著名的演說之一進行斷詞:美國總統 Abraham Lincoln 在南北戰爭期間發表的蓋茨堡演說。
整段演說已存成名為 gettysburg 的字串。
本練習屬於課程
Python 中文本特徵工程
練習說明
- 使用
spacy.load()載入en_core_web_sm模型。 - 針對字串
gettysburg建立一個 Doc 物件doc。 - 使用列表生成式(list comprehension)迭代
doc,產生各個語彙的文字。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
import spacy
# Load the en_core_web_sm model
nlp = ____.____(____)
# Create a Doc object
doc = ____(____)
# Generate the tokens
tokens = [token.____ for token in ____]
print(tokens)