НачатьНачать бесплатно

Подсчёт символов в российских твитах

В этом упражнении вам предоставлен датафрейм tweets, содержащий твиты, связанные с Агентством интернет-исследований России и собранные FiveThirtyEight.

Ваша задача — создать новый признак char_count в tweets, который вычисляет количество символов в каждом твите. Также вычислите среднюю длину твита. Тексты твитов хранятся в признаке content датафрейма tweets.

Обратите внимание: это реальные данные из Twitter, поэтому они могут содержать ненормативную лексику или другой оскорбительный контент (в этом и последующих упражнениях, где также используются реальные данные Twitter).

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте новый признак char_count, применив len к признаку content датафрейма tweets.
  • Выведите среднее количество символов в твитах, вычислив среднее значение признака char_count.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)

# Print the average character count
print(tweets[____].____)
Редактировать и запускать код