Shakespearovský jazykový enkodér
Máš k dispozici předzpracovaný Shakespearovský text a teď ho potřebuješ zakódovat do číselné reprezentace. Nejprve si nadefinuješ kroky kódování a pak je složíš dohromady do pipeline. Pro efektivní práci s velkým množstvím dat využiješ PyTorchovy třídy Dataset a DataLoader, které se postarají o dávkování a náhodné míchání dat.
Následující jsou pro tebe již načteny:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader a preprocess_sentences.
K dispozici máš také processed_shakespeare ze Shakespearovského textu.
Toto cvičení je součástí kurzu
Deep Learning for Text with PyTorch
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]