カスタム割合スケーリング
スライドでは、データを0から1の範囲にスケールする方法を紹介しました。モデリングや表示の目的によっては、別のスケールにしたい場合もあります。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
DAYSONMARKETの最大値と最小値を計算し、変数max_daysとmin_daysに代入します。agg()の結果にはcollect()を使うのを忘れないでください。withColumn()を使って、DAYSONMARKETに基づく新しい列 'percentagescaleddays' を作成します。percentage_scaled_daysは0から100の整数の列にします。整数化にはround()を使ってください。- 新しい列
percentage_scaled_daysのmax()とmin()を出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())