НачатьНачать бесплатно

Часть 2: изучение набора данных

Теперь вы изучите некоторые характеристики набора данных. В частности, вы определите среднюю длину предложений (то есть количество слов в каждом из них) и объём словарного запаса для английского набора данных.

Для этого упражнения предоставлен английский набор данных en_text, содержащий список английских предложений. В этом упражнении вы будете использовать функцию <list>.extend() — разновидность функции <list>.append(). Разберём разницу на примере. Пусть a=[1,2,3] и b=[4,5]. Вызов a.append(b) даст список [1,2,3,[4,5]], тогда как a.extend(b) — список [1,2,3,4,5].

Это упражнение является частью курса

Машинный перевод с Keras

Посмотреть курс

Инструкции к упражнению

  • Вычислите длины каждого предложения с помощью функций split() и len(), перебирая элементы en_text.
  • Вычислите среднюю длину предложений с помощью numpy.
  • Заполните список all_words в теле цикла for, добавив в него все слова, полученные после токенизации предложений.
  • Преобразуйте список all_words в объект типа set и вычислите его длину (размер).

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
Редактировать и запускать код