Map 與 Collect
在 PySpark 中操作資料的主要方式是使用 map()。map() 轉換會接收一個函式,並將它套用到 RDD 的每個元素。它可以用來做許多事,例如為集合中的每個 URL 取得其對應的網站,或僅是將數字平方。在這個簡單的練習中,你會使用 map() 轉換,將先前建立的 numbRDD 中每個數字取立方。接著,將所有元素儲存到一個變數,最後印出結果。
提醒:你的工作空間已經有 SparkContext sc,以及 numbRDD。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 建立
map()轉換,將numbRDD中所有數字取立方。 - 將結果收集到變數
numbers_all中。 - 列印
numbers_all變數的輸出。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)