Encoder pentru limbajul shakespearian
Acum că ai textul shakespearian preprocesат la îndemână, trebuie să îl codifici într-o reprezentare numerică. Va trebui să definești pașii de codificare înainte de a asambla pipeline-ul. Pentru a gestiona eficient cantități mari de date și a realiza codificarea în mod optim, vei folosi Dataset și DataLoader din PyTorch pentru gruparea în loturi și amestecarea datelor.
Următoarele au fost încărcate pentru tine:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader și preprocess_sentences.
De asemenea, ai la dispoziție processed_shakespeare obținut din textul shakespearian.
Acest exercițiu face parte din cursul
Deep Learning pentru text cu PyTorch
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]