시작하기무료로 시작하기

scikit-learn의 KFold()

무작위 숲(random forest) 모델을 만들고 샘플 밖 정확도를 계산하는 동료의 코드를 방금 실행해 보았어요. 그런데 동료의 코드에 random_state 설정이 없어서, 발견된 오류가 동료가 보고한 오류와 완전히 다르다는 점을 눈치챘어요.

이 무작위 숲 모델이 새로운 데이터에서 얼마나 정확할지 더 잘 추정하기 위해, KFold 교차 검증에 사용할 인덱스를 생성하기로 했어요.

이 연습은 강의의 일부입니다

Python에서의 모델 검증

강의 보기

연습 안내

  • KFold() 메서드를 호출하여 분할 수를 5로, 셔플을 사용하고, random_state를 1111로 설정해 데이터를 분할하세요.
  • KFoldsplit() 메서드를 X에 적용하세요.
  • 학습 인덱스와 검증 인덱스 리스트 각각에 몇 개의 인덱스가 있는지 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

from sklearn.model_selection import KFold

# Use KFold
kf = KFold(____, ____, ____)

# Create splits
splits = kf.____(____)

# Print the number of indices
for train_index, val_index in splits:
    print("Number of training indices: %s" % len(____))
    print("Number of validation indices: %s" % len(____))
코드 편집 및 실행