Часть 1: изучение набора данных
Сейчас вы немного изучите набор данных: познакомитесь с тем, как выглядят данные, выведете часть из них и научитесь разбивать предложения на отдельные слова — токенизировать их. Для английского языка токенизация — относительно простая задача, однако в таких языках, как японский, слова разделяются не так последовательно, как в английском.
Для этого упражнения вам предоставлены два набора данных: en_text и fr_text. В en_text содержится список английских предложений, а в fr_text — соответствующий список французских предложений.
Это упражнение является частью курса
Машинный перевод с Keras
Инструкции к упражнению
- Напишите вызов функции
zip(), который перебирает первые 5 предложений из английских (en_text) и французских (fr_text) предложений. - Получите первое английское предложение из
en_text. - Токенизируйте полученное предложение с помощью функции
split(), разбив его по пробелу, и присвойте результат переменнойfirst_words. - Выведите токенизированные слова.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)