Map と Collect
PySpark でデータを操作する主な方法は map() の使用です。map() 変換は関数を受け取り、RDD の各要素に適用します。コレクション内の各 URL に関連するウェブサイトを取得することから、単に数値を二乗することまで、さまざまな処理に使えます。このシンプルな演習では、先ほど作成した RDD numbRDD の各数値を立方にするために map() 変換を使います。次に、すべての要素を変数に保存し、最後に出力を表示します。
SparkContext の sc と numbRDD はすでにワークスペースに用意されています。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
numbRDD内のすべての数値を立方にするmap()変換を作成します。- 結果を
numbers_all変数に収集します。 numbers_all変数の出力を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)