Shakespeansk språkenkodare
Nu när du har den förbehandlade shakespeanska texten till hands behöver du koda om den till en numerisk representation. Definiera enkodningsstegen innan du sätter ihop hela pipelinen. För att hantera stora datamängder effektivt använder du PyTorchs Dataset och DataLoader för att dela upp och blanda data i batchar.
Följande har laddats åt dig:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader och preprocess_sentences.
processed_shakespeare från den shakespeanska texten finns också tillgänglig.
Den här övningen är en del av kursen
Djupinlärning för text med PyTorch
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]