CommencezCommencez gratuitement

Encodeur de langage shakespearien

Avec le texte shakespearien prétraité à portée de main, vous devez maintenant l'encoder en une représentation numérique. Vous devrez définir les étapes d'encodage avant d'assembler le pipeline. Pour mieux gérer de grands volumes de données et encoder efficacement, vous utiliserez les classes Dataset et DataLoader de PyTorch pour regrouper en lots (batching) et mélanger (shuffling) les données.

Les éléments suivants ont été chargés pour vous : torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader et preprocess_sentences.

L'objet processed_shakespeare issu du texte shakespearien est également à votre disposition.

Cette activité fait partie du cours

Apprentissage profond pour le texte avec PyTorch

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
Modifier et exécuter le code