교차 검증
다음 몇 개의 연습 문제에서는 k-겹 교차 검증이라는 절차를 사용해 로지스틱 회귀 모델을 튜닝해 볼 거예요. 이는 보지 못한 데이터(예: test DataFrame)에서의 모델 성능을 추정하는 방법이에요.
작동 방식은 학습 데이터를 몇 개의 파티션으로 나누는 거예요. 정확한 개수는 사용자가 정할 수 있지만, 이 강의에서는 PySpark의 기본값인 3을 사용해요. 데이터를 나눈 뒤, 하나의 파티션을 따로 떼어 두고 나머지 파티션으로 모델을 학습해요. 그런 다음 보류된 파티션에 대해 오차를 측정하죠. 이 과정을 각 파티션에 대해 반복하여, 모든 데이터 블록이 한 번씩은 보류되어 테스트 세트로 사용되도록 합니다. 이후 각 파티션에서 얻은 오차를 평균내요. 이를 모델의 교차 검증 오차라고 하며, 보류된 데이터에서의 실제 오차를 잘 추정해 줍니다.
교차 검증을 사용해 두 하이퍼파라미터 elasticNetParam과 regParam의 가능한 값 쌍으로 그리드를 만들고, 교차 검증 오차로 모든 모델을 비교하여 최적의 값을 선택할 거예요!
교차 검증을 통해 무엇을 추정할 수 있나요?
이 연습은 강의의 일부입니다
