使用 spaCy 進行斷詞(Tokenization)
在這個練習中,你會練習將文字斷詞。這次會使用 Amazon Fine Food Reviews 資料集中的第一則評論。你可以透過提供的 text 物件取得這則評論。
en_core_web_sm 模型已經幫你載入好。你可以呼叫 nlp() 來使用它。你也可以用串列生成式來彙整輸出串列。
本練習屬於課程
使用 spaCy 的自然語言處理
練習說明
- 將預先載入的評論建立為 Doc 容器,並存成
document物件。 - 將
document中所有權標(token)的文字取出並檢視,儲存在變數first_text_tokens中。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")