ПочатиПочніть безкоштовно

Підрахунок слів у виступах TED

ted — це датафрейм, що містить транскрипти 500 виступів TED. Ваше завдання — обчислити нову ознаку word_count, яка міститиме приблизну кількість слів для кожного виступу. Відповідно, вам також потрібно обчислити середню кількість слів у виступах. Транскрипти доступні як ознака transcript у ted.

Щоб виконати це завдання, вам потрібно визначити функцію count_words, яка приймає рядок як аргумент і повертає кількість слів у цьому рядку. Потім застосуйте цю функцію до ознаки transcript у ted, щоб створити нову ознаку word_count і обчислити її середнє значення.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Розбийте string на список слів за допомогою методу split().
  • Поверніть кількість елементів у words, використовуючи len().
  • Застосуйте вашу функцію до стовпця transcript у ted, щоб створити нову ознаку word_count.
  • Обчисліть середню кількість слів у виступах за допомогою mean().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Function that returns number of words in a string
def count_words(string):
	# Split the string into words
    words = ____.____
    
    # Return the number of words
    return ____(____)

# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)

# Print the average word count of the talks
print(ted[____].____)
Редагувати та запускати код