Токенизация предложений с помощью Keras
В этом упражнении вы познакомитесь с Tokenizer из Keras. Это удобный инструмент, который позволяет выполнять ключевые операции обработки текста буквально несколькими строками кода. Например, Tokenizer автоматически сопоставляет слова из вашего словаря с числовыми идентификаторами всего за один вызов функции. Здесь вы разберётесь в этом подробнее.
Вы создадите объект Tokenizer и обучите его на текстовых данных — после этого токенизатор сформирует словарь слов и соответствующих им идентификаторов. Текст для обучения Tokenizer взят из репозитория Udacity на GitHub.
Это упражнение является частью курса
Машинный перевод с Keras
Инструкции к упражнению
- Создайте объект Keras Tokenizer.
- Обучите токенизатор на данных
en_text. - Получите идентификатор для каждого слова
wиз списка["january", "apples", "summer"]. - Выведите слово и соответствующий ему идентификатор.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)