НачатьНачать бесплатно

Токенизация предложений с помощью Keras

В этом упражнении вы познакомитесь с Tokenizer из Keras. Это удобный инструмент, который позволяет выполнять ключевые операции обработки текста буквально несколькими строками кода. Например, Tokenizer автоматически сопоставляет слова из вашего словаря с числовыми идентификаторами всего за один вызов функции. Здесь вы разберётесь в этом подробнее.

Вы создадите объект Tokenizer и обучите его на текстовых данных — после этого токенизатор сформирует словарь слов и соответствующих им идентификаторов. Текст для обучения Tokenizer взят из репозитория Udacity на GitHub.

Это упражнение является частью курса

Машинный перевод с Keras

Посмотреть курс

Инструкции к упражнению

  • Создайте объект Keras Tokenizer.
  • Обучите токенизатор на данных en_text.
  • Получите идентификатор для каждого слова w из списка ["january", "apples", "summer"].
  • Выведите слово и соответствующий ему идентификатор.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
Редактировать и запускать код