Подсчёт символов в российских твитах
В этом упражнении вам предоставлен датафрейм tweets, содержащий твиты, связанные с Агентством интернет-исследований России и собранные FiveThirtyEight.
Ваша задача — создать новый признак char_count в tweets, который вычисляет количество символов в каждом твите. Также вычислите среднюю длину твита. Тексты твитов хранятся в признаке content датафрейма tweets.
Обратите внимание: это реальные данные из Twitter, поэтому они могут содержать ненормативную лексику или другой оскорбительный контент (в этом и последующих упражнениях, где также используются реальные данные Twitter).
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Создайте новый признак
char_count, применивlenк признакуcontentдатафреймаtweets. - Выведите среднее количество символов в твитах, вычислив среднее значение признака
char_count.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)