莎士比亞語料的前處理 pipeline
在 PyBooks,團隊想要將大量的莎士比亞文本資料轉換後再進一步分析。最有效率的方式是建立一個文字處理 pipeline,從前處理步驟開始。
以下物件已為你載入:
torch、nltk、stopwords、PorterStemmer、get_tokenizer。
莎士比亞的文本資料已儲存為 shakespeare,而且句子已經被抽取出來。
本練習屬於課程
在 PyBooks,團隊想要將大量的莎士比亞文本資料轉換後再進一步分析。最有效率的方式是建立一個文字處理 pipeline,從前處理步驟開始。
以下物件已為你載入:
torch、nltk、stopwords、PorterStemmer、get_tokenizer。
莎士比亞的文本資料已儲存為 shakespeare,而且句子已經被抽取出來。
本練習屬於課程