사용자 지정 퍼센트 스케일링
슬라이드에서는 데이터를 0과 1 사이로 스케일링하는 방법을 보여 드렸어요. 때로는 모델링이나 표시 목적에 따라 다른 방식으로 스케일링해야 할 수도 있습니다.
이 연습은 강의의 일부입니다
PySpark로 하는 Feature Engineering
연습 안내
DAYSONMARKET의 최댓값과 최솟값을 계산해 각각 변수max_days,min_days에 저장하세요.agg()결과에는collect()를 사용하는 것을 잊지 마세요.withColumn()을 사용해DAYSONMARKET를 바탕으로 'percentagescaleddays'라는 새 열을 만드세요.percentage_scaled_days는 0부터 100까지의 정수여야 합니다. 정수로 만들려면round()를 사용하세요.- 새 열
percentage_scaled_days의max()와min()을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())