Map 和 Collect
在 PySpark 中操作数据的主要方式是使用 map()。map() 转换接收一个函数,并将其应用到 RDD 的每个元素上。它既可以用来完成很多事情,比如为集合中的每个 URL 获取对应网站,也可以只是对数字求平方。在这个简单练习中,您将使用 map() 转换对先前创建的 RDD numbRDD 中的每个数字求立方。接着,您会把所有元素存入一个变量,最后打印输出。
请记住,您的工作空间中已经有 SparkContext sc 和 numbRDD 可用。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 创建一个
map()转换,使numbRDD中的所有数字都被求立方。 - 将结果收集到变量
numbers_all中。 - 打印变量
numbers_all的输出。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)