始める無料で始める

カスタム割合スケーリング

スライドでは、データを0から1の範囲にスケールする方法を紹介しました。モデリングや表示の目的によっては、別のスケールにしたい場合もあります。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • DAYSONMARKET の最大値と最小値を計算し、変数 max_daysmin_days に代入します。agg() の結果には collect() を使うのを忘れないでください。
  • withColumn() を使って、DAYSONMARKET に基づく新しい列 'percentagescaleddays' を作成します。
  • percentage_scaled_days は0から100の整数の列にします。整数化には round() を使ってください。
  • 新しい列 percentage_scaled_daysmax()min() を出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
コードを編集して実行