开始使用免费开始使用

莎士比亚文本编码器

现在,您已经完成了莎士比亚文本的预处理,接下来需要将其编码为数值表示。在搭建完整流水线前,先定义好编码步骤。为更好地处理海量数据并高效执行编码,您将使用 PyTorch 的 Dataset 和 DataLoader 来进行批处理与打乱。

以下对象已为您加载: torchnltkstopwordsPorterStemmerget_tokenizerCountVectorizerDatasetDataLoader,以及 preprocess_sentences

从莎士比亚文本得到的 processed_shakespeare 也可供您使用。

本练习是课程的一部分

使用 PyTorch 的文本深度学习

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
编辑并运行代码