НачатьНачать бесплатно

Подсчёт слов в выступлениях TED

ted — это датафрейм, содержащий транскрипты 500 выступлений TED. Ваша задача — вычислить новый признак word_count, который содержит приблизительное количество слов в каждом выступлении. Кроме того, вам нужно вычислить среднее количество слов. Транскрипты доступны в виде признака transcript в датафрейме ted.

Для выполнения задания определите функцию count_words, которая принимает строку в качестве аргумента и возвращает количество слов в ней. Затем примените эту функцию к столбцу transcript датафрейма ted, чтобы создать новый признак word_count, и вычислите его среднее значение.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Разбейте string на список слов с помощью метода split().
  • Верните количество элементов в words с помощью len().
  • Примените вашу функцию к столбцу transcript датафрейма ted, чтобы создать новый признак word_count.
  • Вычислите среднее количество слов в выступлениях с помощью mean().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Function that returns number of words in a string
def count_words(string):
	# Split the string into words
    words = ____.____
    
    # Return the number of words
    return ____(____)

# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)

# Print the average word count of the talks
print(ted[____].____)
Редактировать и запускать код