НачатьНачать бесплатно

Кодировщик шекспировского языка

Теперь, когда предобработанный шекспировский текст готов к работе, нужно преобразовать его в числовое представление. Сначала вы определите шаги кодирования, а затем соберёте конвейер целиком. Чтобы эффективно обрабатывать большие объёмы данных и выполнять кодирование, вы воспользуетесь Dataset и DataLoader из PyTorch для формирования батчей и перемешивания данных.

Для вас уже загружены следующие модули: torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader и preprocess_sentences.

Также доступна переменная processed_shakespeare с обработанным шекспировским текстом.

Это упражнение является частью курса

Глубокое обучение для работы с текстом на PyTorch

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
Редактировать и запускать код