Підрахунок слів у виступах TED
ted — це датафрейм, що містить транскрипти 500 виступів TED. Ваше завдання — обчислити нову ознаку word_count, яка міститиме приблизну кількість слів для кожного виступу. Відповідно, вам також потрібно обчислити середню кількість слів у виступах. Транскрипти доступні як ознака transcript у ted.
Щоб виконати це завдання, вам потрібно визначити функцію count_words, яка приймає рядок як аргумент і повертає кількість слів у цьому рядку. Потім застосуйте цю функцію до ознаки transcript у ted, щоб створити нову ознаку word_count і обчислити її середнє значення.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Розбийте
stringна список слів за допомогою методуsplit(). - Поверніть кількість елементів у
words, використовуючиlen(). - Застосуйте вашу функцію до стовпця
transcriptуted, щоб створити нову ознакуword_count. - Обчисліть середню кількість слів у виступах за допомогою
mean().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)