文本预处理
在构建推荐系统或其他模型之前,必须先对文本进行预处理。
这里提供了一段福尔摩斯的文本。请使用视频中介绍的多种技术对该文本进行预处理,为后续分析做好准备。
变量 text 取自 Arthur Conan Doyle 的《巴斯克维尔的猎犬》片段。
以下包和函数已为您加载:
nltk、torch、get_tokenizer、PorterStemmer、stopwords。
本练习是课程的一部分
使用 PyTorch 的文本深度学习
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Initialize and tokenize the text
tokenizer = ____("basic_english")
tokens = ____(____)
print(tokens)