Кодувальник шекспірівської мови
Маючи під рукою попередньо оброблений шекспірівський текст, вам потрібно закодувати його у числове подання. Спочатку визначте кроки кодування, а вже потім зберіть конвеєр. Щоб краще працювати з великими обсягами даних і ефективно виконувати кодування, використовуйте Dataset і DataLoader у PyTorch для пакетування й перемішування даних.
Для вас уже імпортовано:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader та preprocess_sentences.
Змінна processed_shakespeare, отримана зі шекспірівського тексту, також доступна.
Ця вправа є частиною курсу
Глибоке навчання для тексту з PyTorch
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]