Часть 2: изучение набора данных
Теперь вы изучите некоторые характеристики набора данных. В частности, вы определите среднюю длину предложений (то есть количество слов в каждом из них) и объём словарного запаса для английского набора данных.
Для этого упражнения предоставлен английский набор данных en_text, содержащий список английских предложений. В этом упражнении вы будете использовать функцию <list>.extend() — разновидность функции <list>.append(). Разберём разницу на примере. Пусть a=[1,2,3] и b=[4,5]. Вызов a.append(b) даст список [1,2,3,[4,5]], тогда как a.extend(b) — список [1,2,3,4,5].
Это упражнение является частью курса
Машинный перевод с Keras
Инструкции к упражнению
- Вычислите длины каждого предложения с помощью функций
split()иlen(), перебирая элементыen_text. - Вычислите среднюю длину предложений с помощью
numpy. - Заполните список
all_wordsв теле циклаfor, добавив в него все слова, полученные после токенизации предложений. - Преобразуйте список
all_wordsв объект типаsetи вычислите его длину (размер).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)