ÎncepețiÎncepe gratuit

Encoder pentru limbajul shakespearian

Acum că ai textul shakespearian preprocesат la îndemână, trebuie să îl codifici într-o reprezentare numerică. Va trebui să definești pașii de codificare înainte de a asambla pipeline-ul. Pentru a gestiona eficient cantități mari de date și a realiza codificarea în mod optim, vei folosi Dataset și DataLoader din PyTorch pentru gruparea în loturi și amestecarea datelor.

Următoarele au fost încărcate pentru tine: torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader și preprocess_sentences.

De asemenea, ai la dispoziție processed_shakespeare obținut din textul shakespearian.

Acest exercițiu face parte din cursul

Deep Learning pentru text cu PyTorch

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
Editează și rulează codul