Kom igångKom igång gratis

Shakespeansk språkenkodare

Nu när du har den förbehandlade shakespeanska texten till hands behöver du koda om den till en numerisk representation. Definiera enkodningsstegen innan du sätter ihop hela pipelinen. För att hantera stora datamängder effektivt använder du PyTorchs Dataset och DataLoader för att dela upp och blanda data i batchar.

Följande har laddats åt dig: torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader och preprocess_sentences.

processed_shakespeare från den shakespeanska texten finns också tillgänglig.

Den här övningen är en del av kursen

Djupinlärning för text med PyTorch

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
Redigera och kör kod