始める無料で始める

データを読み込む

データを読み込むことは、PySpark でデータサイエンスを行う最初の一歩です。業界標準となった Parquet ファイルを活用してみましょう!

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • 動画の演習で紹介したとおり、parquet() リーダーを使って 'Real_Estate.parq' を読み込みます。
  • columns を使って列名のリストを出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Read the file into a dataframe
df = spark.read.____(____)
# Print columns in dataframe
____(df.____)
コードを編集して実行