Koder języka szekspirowskiego
Masz już wstępnie przetworzone teksty szekspirowskie – teraz czas zakodować je w postaci numerycznej. Zdefiniujesz kolejne kroki kodowania, a następnie złożysz je w potok przetwarzania. Aby sprawnie obsługiwać duże ilości danych i efektywnie przeprowadzić kodowanie, skorzystasz z klas Dataset i DataLoader z PyTorch, które umożliwiają tworzenie partii danych i ich losowe mieszanie.
Następujące elementy zostały już załadowane:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader oraz preprocess_sentences.
Dostępna jest też zmienna processed_shakespeare zawierająca przetworzony tekst szekspirowski.
To ćwiczenie jest częścią kursu
Uczenie głębokie dla tekstu z PyTorch
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]