Подсчёт слов в выступлениях TED
ted — это датафрейм, содержащий транскрипты 500 выступлений TED. Ваша задача — вычислить новый признак word_count, который содержит приблизительное количество слов в каждом выступлении. Кроме того, вам нужно вычислить среднее количество слов. Транскрипты доступны в виде признака transcript в датафрейме ted.
Для выполнения задания определите функцию count_words, которая принимает строку в качестве аргумента и возвращает количество слов в ней. Затем примените эту функцию к столбцу transcript датафрейма ted, чтобы создать новый признак word_count, и вычислите его среднее значение.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Разбейте
stringна список слов с помощью методаsplit(). - Верните количество элементов в
wordsс помощьюlen(). - Примените вашу функцию к столбцу
transcriptдатафреймаted, чтобы создать новый признакword_count. - Вычислите среднее количество слов в выступлениях с помощью
mean().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)