신장 질환 사례 연구 III: 전체 파이프라인
이제 모든 변환과 XGBClassifier를 함께 묶어 전체 파이프라인을 만들어 볼 차례예요!
이전 연습 문제에서 만든 numeric_categorical_union 외에도, 우리가 미리 만들어 둔 Dictifier() 변환과 DictVectorizer() 두 가지가 더 필요합니다.
파이프라인을 만든 뒤, 교차 검증을 수행해 성능을 확인해 보세요.
이 연습은 강의의 일부입니다
XGBoost로 익히는 Extreme Gradient Boosting
연습 안내
numeric_categorical_union,Dictifier(),DictVectorizer(sort=False)변환과max_depth=3인xgb.XGBClassifier()추정기를 사용해 파이프라인을 만드세요. 변환의 이름은 각각"featureunion","dictifier","vectorizer", 추정기는"clf"로 지정합니다.cross_val_score()를 사용해pipeline에 대해 3-폴드 교차 검증을 수행하세요. 파이프라인pipeline, 특징kidney_data, 정답 레이블y를 전달하고,scoring은"roc_auc",cv는3으로 설정하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create full pipeline
pipeline = ____([
("____", ____),
("____", ____),
("____", ____),
("____", ____)
])
# Perform cross-validation
cross_val_scores = ____(____, ____, ____, ____="____", ____=____)
# Print avg. AUC
print("3-fold AUC: ", np.mean(cross_val_scores))