scikit-learn의 KFold()
무작위 숲(random forest) 모델을 만들고 샘플 밖 정확도를 계산하는 동료의 코드를 방금 실행해 보았어요. 그런데 동료의 코드에 random_state 설정이 없어서, 발견된 오류가 동료가 보고한 오류와 완전히 다르다는 점을 눈치챘어요.
이 무작위 숲 모델이 새로운 데이터에서 얼마나 정확할지 더 잘 추정하기 위해, KFold 교차 검증에 사용할 인덱스를 생성하기로 했어요.
이 연습은 강의의 일부입니다
Python에서의 모델 검증
연습 안내
KFold()메서드를 호출하여 분할 수를 5로, 셔플을 사용하고, random_state를 1111로 설정해 데이터를 분할하세요.KFold의split()메서드를X에 적용하세요.- 학습 인덱스와 검증 인덱스 리스트 각각에 몇 개의 인덱스가 있는지 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from sklearn.model_selection import KFold
# Use KFold
kf = KFold(____, ____, ____)
# Create splits
splits = kf.____(____)
# Print the number of indices
for train_index, val_index in splits:
print("Number of training indices: %s" % len(____))
print("Number of validation indices: %s" % len(____))