开始使用免费开始使用

莎士比亚语料的预处理流水线

在 PyBooks,团队希望将庞大的莎士比亚文本数据转换后再做深入分析。最高效的方式是构建一条文本处理流水线,从预处理步骤开始。

以下对象已为您加载: torchnltkstopwordsPorterStemmerget_tokenizer

莎士比亚文本数据保存在 shakespeare 中,句子已事先抽取。

本练习是课程的一部分

使用 PyTorch 的文本深度学习

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a list of stopwords
stop_words = set(____(____))
编辑并运行代码