Унитарное кодирование названий книг
Компания PyBooks хочет каталогизировать и проанализировать жанры книг в своей библиотеке. Примените унитарное кодирование (one-hot encoding) к списку жанров, чтобы сделать их пригодными для машинной обработки.
Библиотека torch уже импортирована.
Это упражнение является частью курса
Глубокое обучение для работы с текстом на PyTorch
Инструкции к упражнению
- Определите размер словаря и сохраните его в переменную
vocab_size. - Создайте унитарные векторы (one-hot vectors), используя подходящий метод
torchи значениеvocab_size. - Создайте словарь, отображающий жанры на соответствующие им унитарные векторы, с помощью генератора словаря; ключами словаря должны быть названия жанров.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
genres = ['Fiction','Non-fiction','Biography', 'Children','Mystery']
# Define the size of the vocabulary
vocab_size = ____(____)
# Create one-hot vectors
one_hot_vectors = torch.____(____)
# Create a dictionary mapping genres to their one-hot vectors
one_hot_dict = {____: ____[i] for i, genre in enumerate(genres)}
for genre, vector in one_hot_dict.items():
print(f'{genre}: {vector.numpy()}')