データを読み込む
データを読み込むことは、PySpark でデータサイエンスを行う最初の一歩です。業界標準となった Parquet ファイルを活用してみましょう!
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
- 動画の演習で紹介したとおり、
parquet()リーダーを使って'Real_Estate.parq'を読み込みます。 columnsを使って列名のリストを出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Read the file into a dataframe
df = spark.read.____(____)
# Print columns in dataframe
____(df.____)