将推文加载到 DataFrame
现在是时候把数据导入 pandas 的 DataFrame,便于大规模分析推文了。
我们将使用一个包含 "#rstats" 或 "#python" 话题标签的推文数据集。该数据集以推文 JSON 对象列表的形式存储在 data_science_json 中。
本课程涉及的概念较多,您可能会有遗忘。如果需要快速复习,欢迎下载并随身查看这份 pandas 基础速查表!
请注意:这些是来自 Twitter 的真实数据,因此可能包含脏话或其他不当内容(本练习及后续任何使用真实 Twitter 数据的练习均有此风险)。
本练习是课程的一部分
在 Python 中分析社交媒体数据
练习说明
- 导入
pandas(按照惯例将其别名设为pd)。 - 使用
flatten_tweets()扁平化data_science_json中的推文,并将结果保存为tweets。 - 使用
pd.DataFrame()基于tweets创建一个 DataFrame。 - 打印前 5 条推文的文本内容。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import pandas
import ____ as ____
# Flatten the tweets and store in `tweets`
tweets = ____(____)
# Create a DataFrame from `tweets`
ds_tweets = ____(____)
# Print out the first 5 tweets from this dataset
print(ds_tweets[____].values[0:5])