始める無料で始める

RDD から DataFrame へ

RDD と同様に、DataFrame も Spark における不変かつ分散したデータ構造です。RDD は Spark の基本的なデータ構造ですが、実務では RDD よりも DataFrame のほうが扱いやすい場面が多いです。したがって、RDD を DataFrame に変換する方法を理解しておくことが重要です。

この演習では、まずすでに用意されている sample_list から RDD を作成します。この RDD は、各タプルに人名と年齢を含む ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) のリストです。次に、この RDD とスキーマ('Name' と 'Age' のリスト)を使って DataFrame を作成し、最後に出力が PySpark の DataFrame であることを確認します。

作業スペースにはすでに SparkContext sc と SparkSession spark が用意されています。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • sample_list から RDD を作成します。
  • 上で作成した RDD とスキーマを使って PySpark の DataFrame を作成します。
  • 出力が PySpark の DataFrame であることを確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
コードを編集して実行