莎士比亚文本编码器
现在,您已经完成了莎士比亚文本的预处理,接下来需要将其编码为数值表示。在搭建完整流水线前,先定义好编码步骤。为更好地处理海量数据并高效执行编码,您将使用 PyTorch 的 Dataset 和 DataLoader 来进行批处理与打乱。
以下对象已为您加载:
torch、nltk、stopwords、PorterStemmer、get_tokenizer、CountVectorizer、Dataset、DataLoader,以及 preprocess_sentences。
从莎士比亚文本得到的 processed_shakespeare 也可供您使用。
本练习是课程的一部分
使用 PyTorch 的文本深度学习
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]