在 spaCy 中加入管線元件
你常會用現成的 spaCy 模型來處理各種 NLP 任務。不過,有時像是句子切分這類的現成流程元件,可能需要很久才達到預期效果。這個練習要你在 spaCy 模型(文字處理流程)中加入一個流程元件。
這題會用到 Amazon Fine Food Reviews 資料集中的前 5 則評論。你可以透過字串 texts 取得這些評論。
spaCy 套件已經替你匯入,可以直接使用。
本練習屬於課程
使用 spaCy 的自然語言處理
練習說明
- 載入空白的
spaCy英文模型,並在模型中加入sentencizer元件。 - 為
texts建立一個Doc容器,建立一個清單來儲存該文件的sentences,並列印句子數量。 - 從
sentences清單中,列印第二個句子的詞元清單。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])