始める無料で始める

Map と Collect

PySpark でデータを操作する主な方法は map() の使用です。map() 変換は関数を受け取り、RDD の各要素に適用します。コレクション内の各 URL に関連するウェブサイトを取得することから、単に数値を二乗することまで、さまざまな処理に使えます。このシンプルな演習では、先ほど作成した RDD numbRDD の各数値を立方にするために map() 変換を使います。次に、すべての要素を変数に保存し、最後に出力を表示します。

SparkContext の scnumbRDD はすでにワークスペースに用意されています。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • numbRDD 内のすべての数値を立方にする map() 変換を作成します。
  • 結果を numbers_all 変数に収集します。
  • numbers_all 変数の出力を表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)

# Collect the results
numbers_all = cubedRDD.____()

# Print the numbers from numbers_all
for numb in ____:
	print(____)
コードを編集して実行