НачатьНачать бесплатно

Часть 1: изучение набора данных

Сейчас вы немного изучите набор данных: познакомитесь с тем, как выглядят данные, выведете часть из них и научитесь разбивать предложения на отдельные слова — токенизировать их. Для английского языка токенизация — относительно простая задача, однако в таких языках, как японский, слова разделяются не так последовательно, как в английском.

Для этого упражнения вам предоставлены два набора данных: en_text и fr_text. В en_text содержится список английских предложений, а в fr_text — соответствующий список французских предложений.

Это упражнение является частью курса

Машинный перевод с Keras

Посмотреть курс

Инструкции к упражнению

  • Напишите вызов функции zip(), который перебирает первые 5 предложений из английских (en_text) и французских (fr_text) предложений.
  • Получите первое английское предложение из en_text.
  • Токенизируйте полученное предложение с помощью функции split(), разбив его по пробелу, и присвойте результат переменной first_words.
  • Выведите токенизированные слова.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
Редактировать и запускать код