すべてを統合する I
PySpark の基礎をしっかり固め、Spark SQL や DataFrame、高度な操作を含む実践的なシナリオに取り組んできました。いよいよ、これまでの学習内容をすべてまとめましょう。次の2つの演習では、SparkSession と DataFrame を作成し、DataFrame をキャッシュして分析を行い、その結果を確認します。
この演習はコースの一部です
PySpark 入門
演習の手順
SparkSessionをpyspark.sqlからインポートします。SparkSessionを使って、final_sparkという名前の新しいSparkSession.builder.getOrCreate()を作成します。my_sparkをコンソールに出力して、SparkSessionであることを確認します。- あらかじめ用意されたスキーマと列定義をもとに、新しいデータフレームを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import SparkSession from pyspark.sql
from ____ import ____
# Create my_spark
my_spark = SparkSession.builder.appName(____).____
# Print my_spark
____
# Load dataset into a DataFrame
df = ____(data, schema=columns)
df.show()