莎士比亚语料的预处理流水线
在 PyBooks,团队希望将庞大的莎士比亚文本数据转换后再做深入分析。最高效的方式是构建一条文本处理流水线,从预处理步骤开始。
以下对象已为您加载:
torch、nltk、stopwords、PorterStemmer、get_tokenizer。
莎士比亚文本数据保存在 shakespeare 中,句子已事先抽取。
本练习是课程的一部分
在 PyBooks,团队希望将庞大的莎士比亚文本数据转换后再做深入分析。最高效的方式是构建一条文本处理流水线,从预处理步骤开始。
以下对象已为您加载:
torch、nltk、stopwords、PorterStemmer、get_tokenizer。
莎士比亚文本数据保存在 shakespeare 中,句子已事先抽取。
本练习是课程的一部分