호텔 예약 데이터셋의 드리프트
이전 장에서 예약 취소를 예측하는 모델의 비즈니스 가치와 ROC AUC 성능을 계산했어요. 그 결과 플롯에서 몇 가지 경고를 확인했기 때문에, 이제 분석 데이터에 드리프트가 있는지 조사해야 해요.
이 연습에서는 다변량 드리프트 탐지 방법을 초기화하고, 그 결과를 이전 장에서 계산한 성능 결과와 비교해 볼 거예요.
StandardDeviationThreshold는 이미 임포트되어 있고, 비즈니스 가치와 ROC AUC 결과는 perf_results 변수에 저장되어 있으며 feature_column_names도 이미 정의되어 있어요.
이 연습은 강의의 일부입니다
Python으로 Machine Learning 모니터링
연습 안내
StandardDeviationThreshold메서드를 초기화하고std_lower_multiplier를2,std_upper_multiplier파라미터를1로 설정하세요.- 다음 특성 이름
country,lead_time,parking_spaces,hotel을 이 순서대로 추가하세요. - 앞에서 정의한 임계값과 특성 이름을
DataReconstructionDriftCalculator에 전달하세요. - 다변량 드리프트 탐지 결과(
mv_results)와 성능 결과(perf_results)를 모두 포함한 비교 플롯을 표시하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()