Encodeur de langage shakespearien
Avec le texte shakespearien prétraité à portée de main, vous devez maintenant l'encoder en une représentation numérique. Vous devrez définir les étapes d'encodage avant d'assembler le pipeline. Pour mieux gérer de grands volumes de données et encoder efficacement, vous utiliserez les classes Dataset et DataLoader de PyTorch pour regrouper en lots (batching) et mélanger (shuffling) les données.
Les éléments suivants ont été chargés pour vous :
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader et preprocess_sentences.
L'objet processed_shakespeare issu du texte shakespearien est également à votre disposition.
Cette activité fait partie du cours
Apprentissage profond pour le texte avec PyTorch
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]