시작하기무료로 시작하기

범주형 특성을 사용한 회귀

이제 각 노래의 장르에 대한 이진 특성을 포함하는 music_dummies을 생성했으니, 노래 인기도를 예측하기 위해 릿지 회귀 모델을 구축할 시간입니다.

music_dummies는 미리 로드되어 있으며, Ridge, cross_val_score, numpynp로, KFold 객체는 kf로 저장 및 로드되어 있습니다.

모델은 평균 RMSE를 계산하여 평가되지만, 먼저 각 폴드의 점수를 양수 값으로 변환하고 제곱근을 구해야 합니다. 이 지표는 모델 예측의 평균 오차를 보여주므로, 타깃 값의 표준 편차인 "popularity"와 비교할 수 있습니다.

이 연습은 강의의 일부입니다

scikit-learn으로 배우는 지도 학습

강의 보기

연습 안내

  • X를 생성하세요. 여기에는 music_dummies의 모든 특성을 포함하며, y"popularity"열로 구성됩니다.
  • alpha를 0.2로 설정한 릿지 회귀 모델을 인스턴스화하세요.
  • 릿지 모델을 사용하여 Xy에 대해 교차 검증을 수행하고, cvkf와 같게 설정하며, 음수 평균 제곱 오차를 채점 지표로 사용하세요.
  • 음수 scores를 양수로 변환한 다음 제곱근을 취하여 RMSE 값을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create X and y
X = ____
y = ____

# Instantiate a ridge model
ridge = ____

# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")

# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))
코드 편집 및 실행