始める無料で始める

DataFrame を使う

Spark の中核となるデータ構造は Resilient Distributed Dataset(RDD)です。これは、クラスター内の複数ノードにデータを分割して Spark の“魔法”を発揮させる、低レベルのオブジェクトです。ただし、RDD を直接扱うのは難しいため、このコースでは RDD の上に構築された抽象化である Spark DataFrame を使います。

Spark DataFrame は、SQL のテーブル(列に変数、行に観測値が入るテーブル)のように振る舞うよう設計されています。理解しやすいだけでなく、DataFrame は RDD よりも複雑な処理に対して最適化されています。

列や行を加工・結合し始めると、同じ結果に到達する方法は数多くありますが、実行時間は大きく異なることがあります。RDD を使う場合、クエリの最適化方法を見つけるのはデータサイエンティストの役割ですが、DataFrame の実装には多くの最適化が組み込まれています!

Spark DataFrame を使い始めるには、まず SparkContext から SparkSession オブジェクトを作成します。SparkContext はクラスターへの接続、SparkSession はその接続を操作するためのインターフェースだと考えるとよいでしょう。

この先のコースでは、作業スペースに spark という名前の SparkSession が用意されています!

次のうち、RDD に対する Spark DataFrame の利点はどれですか?

この演習はコースの一部です

PySpark入門

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する