Zacznij terazZacznij za darmo

Koder języka szekspirowskiego

Masz już wstępnie przetworzone teksty szekspirowskie – teraz czas zakodować je w postaci numerycznej. Zdefiniujesz kolejne kroki kodowania, a następnie złożysz je w potok przetwarzania. Aby sprawnie obsługiwać duże ilości danych i efektywnie przeprowadzić kodowanie, skorzystasz z klas Dataset i DataLoader z PyTorch, które umożliwiają tworzenie partii danych i ich losowe mieszanie.

Następujące elementy zostały już załadowane: torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader oraz preprocess_sentences.

Dostępna jest też zmienna processed_shakespeare zawierająca przetworzony tekst szekspirowski.

To ćwiczenie jest częścią kursu

Uczenie głębokie dla tekstu z PyTorch

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
Edytuj i uruchom kod