開始使用免費開始

莎士比亞語料的前處理 pipeline

在 PyBooks,團隊想要將大量的莎士比亞文本資料轉換後再進一步分析。最有效率的方式是建立一個文字處理 pipeline,從前處理步驟開始。

以下物件已為你載入: torchnltkstopwordsPorterStemmerget_tokenizer

莎士比亞的文本資料已儲存為 shakespeare,而且句子已經被抽取出來。

本練習屬於課程

Deep Learning for Text with PyTorch

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a list of stopwords
stop_words = set(____(____))
編輯並執行程式碼