俄语推文的字符计数
在本练习中,您将获得一个数据框 tweets,其中包含与俄罗斯"网络研究署"(Internet Research Agency)相关并由 FiveThirtyEight 汇编的一些推文。
您的任务是:在 tweets 中创建一个新的特征 'char_count',用于计算每条推文的字符数。此外,计算每条推文的平均长度。推文文本位于 tweets 的 content 特征中。
请注意:这些是来自 Twitter 的真实数据,因此可能包含不雅或具有冒犯性的内容(本练习及之后任何使用真实 Twitter 数据的练习均可能如此)。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 对
tweets的content特征应用len,创建新的特征char_count。 - 计算并打印
char_count特征的均值,以得到推文的平均字符数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)