범주형 특성을 사용한 회귀
이제 각 노래의 장르에 대한 이진 특성을 포함하는 music_dummies을 생성했으니, 노래 인기도를 예측하기 위해 릿지 회귀 모델을 구축할 시간입니다.
music_dummies는 미리 로드되어 있으며, Ridge, cross_val_score, numpy는 np로, KFold 객체는 kf로 저장 및 로드되어 있습니다.
모델은 평균 RMSE를 계산하여 평가되지만, 먼저 각 폴드의 점수를 양수 값으로 변환하고 제곱근을 구해야 합니다. 이 지표는 모델 예측의 평균 오차를 보여주므로, 타깃 값의 표준 편차인 "popularity"와 비교할 수 있습니다.
이 연습은 강의의 일부입니다
scikit-learn으로 배우는 지도 학습
연습 안내
X를 생성하세요. 여기에는music_dummies의 모든 특성을 포함하며,y는"popularity"열로 구성됩니다.alpha를 0.2로 설정한 릿지 회귀 모델을 인스턴스화하세요.- 릿지 모델을 사용하여
X와y에 대해 교차 검증을 수행하고,cv를kf와 같게 설정하며, 음수 평균 제곱 오차를 채점 지표로 사용하세요. - 음수
scores를 양수로 변환한 다음 제곱근을 취하여 RMSE 값을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))