開始使用免費開始

使用 spaCy 進行斷詞(Tokenization)

在這個練習中,你會練習將文字斷詞。這次會使用 Amazon Fine Food Reviews 資料集中的第一則評論。你可以透過提供的 text 物件取得這則評論。

en_core_web_sm 模型已經幫你載入好。你可以呼叫 nlp() 來使用它。你也可以用串列生成式來彙整輸出串列。

本練習屬於課程

使用 spaCy 的自然語言處理

檢視課程

練習說明

  • 將預先載入的評論建立為 Doc 容器,並存成 document 物件。
  • document 中所有權標(token)的文字取出並檢視,儲存在變數 first_text_tokens 中。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
編輯並執行程式碼