始める無料で始める

すべてを統合する I

PySpark の基礎をしっかり固め、Spark SQL や DataFrame、高度な操作を含む実践的なシナリオに取り組んできました。いよいよ、これまでの学習内容をすべてまとめましょう。次の2つの演習では、SparkSession と DataFrame を作成し、DataFrame をキャッシュして分析を行い、その結果を確認します。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • SparkSessionpyspark.sql からインポートします。
  • SparkSession を使って、final_spark という名前の新しい SparkSession.builder.getOrCreate() を作成します。
  • my_spark をコンソールに出力して、SparkSession であることを確認します。
  • あらかじめ用意されたスキーマと列定義をもとに、新しいデータフレームを作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
コードを編集して実行