何を予測しますか?
次のフィールド(列)のうち、私たちが予測しようとしている値はどれですか。
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
- 上の列の中から、従属変数
$Y$として使用する列を特定してください。 - 読み込まれているデータセット
dfから、select()を使って従属変数のみを抽出し、変数Y_dfに保存します。 Y_dfに対してdescribe()を実行し、show()を呼び出して、従属変数の要約統計量を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()