Codificador del lenguaje shakespeariano
Con el texto de Shakespeare preprocesado a tu disposición, ahora necesitas codificarlo en una representación numérica. Deberás definir los pasos de codificación antes de montar la canalización. Para manejar mejor grandes cantidades de datos y realizar la codificación de manera eficiente, utilizarás Dataset y DataLoader de PyTorch para agrupar y barajar los datos.
Se han cargado para ti los siguientes elementos:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader y preprocess_sentences.
También tienes disponible el processed_shakespeare del texto de Shakespeare.
Este ejercicio forma parte del curso
Deep Learning para texto con PyTorch
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]