Кодировщик шекспировского языка
Теперь, когда предобработанный шекспировский текст готов к работе, нужно преобразовать его в числовое представление. Сначала вы определите шаги кодирования, а затем соберёте конвейер целиком. Чтобы эффективно обрабатывать большие объёмы данных и выполнять кодирование, вы воспользуетесь Dataset и DataLoader из PyTorch для формирования батчей и перемешивания данных.
Для вас уже загружены следующие модули:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader и preprocess_sentences.
Также доступна переменная processed_shakespeare с обработанным шекспировским текстом.
Это упражнение является частью курса
Глубокое обучение для работы с текстом на PyTorch
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]