开始使用免费开始使用

玩转推文,第 1 轮

还记得在本课程前面的章节中,您一直在一家网络机构担任数据分析师吗?您表现很出色,现在又接到一个新项目了 ;) 在本章中,您将分析一种新类型的数据:JSON 输出。

工程团队提供了一个数据采集的输出文件,里面包含在 RStudio Conf 2018 期间收集到的推文。由于这个数据集是 JSON 格式,您已经在 R 中将其读取为一个嵌套列表。

首先,您想对这个数据集做一些基础探索,purrr 将大显身手。相关包已为您加载,数据集 rstudioconf 已在您的工作区中可用。

注意:不要尝试打印整个数据集——它太大,无法在 datacamp 控制台完整显示。

请注意,这些都是来自 Twitter 的真实数据,因此可能包含不雅或冒犯性内容(本练习以及后续任何使用真实 Twitter 数据的练习均可能如此)。

本练习是课程的一部分

使用 purrr 的函数式编程进阶

查看课程

练习说明

  • 打印列表的第一个元素,以便了解其内容与结构。

  • 由于您想聚焦于原创推文(非转推),请使用每个子列表中的逻辑元素 "is_retweet" 创建一个"非转推"的子列表。

  • 使用适用于整数的 map_* 变体,从新子列表的每个元素中提取 "favorite_count" 元素。

  • 计算上一步结果的中位数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Print the first element of the list to the console 


# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")

# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")

# Get the median of favorite_count for non_rt
___(___)
编辑并运行代码