開始使用免費開始

在 spaCy 中加入管線元件

你常會用現成的 spaCy 模型來處理各種 NLP 任務。不過,有時像是句子切分這類的現成流程元件,可能需要很久才達到預期效果。這個練習要你在 spaCy 模型(文字處理流程)中加入一個流程元件。

這題會用到 Amazon Fine Food Reviews 資料集中的前 5 則評論。你可以透過字串 texts 取得這些評論。

spaCy 套件已經替你匯入,可以直接使用。

本練習屬於課程

使用 spaCy 的自然語言處理

檢視課程

練習說明

  • 載入空白的 spaCy 英文模型,並在模型中加入 sentencizer 元件。
  • texts 建立一個 Doc 容器,建立一個清單來儲存該文件的 sentences,並列印句子數量。
  • sentences 清單中,列印第二個句子的詞元清單。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
編輯並執行程式碼