Machine Learning 파이프라인
다음 두 장에서는 데이터 입력부터 모델 평가까지, Machine Learning 파이프라인의 모든 단계를 차근차근 살펴보겠습니다. 시작해 볼까요?
pyspark.ml 모듈의 핵심에는 Transformer와 Estimator 클래스가 있어요. 모듈의 거의 모든 다른 클래스가 이 두 기본 클래스와 유사하게 동작합니다.
Transformer 클래스에는 DataFrame을 받아 새로운 DataFrame을 반환하는 .transform() 메서드가 있어요. 보통은 원본에 새 열을 덧붙인 형태로 반환합니다. 예를 들어, 연속형 특성에서 구간을 만들어 주는 Bucketizer 클래스를 사용하거나, 주성분 분석을 이용해 데이터셋의 차원을 축소하는 PCA 클래스를 사용할 수 있어요.
Estimator 클래스는 모두 .fit() 메서드를 구현합니다. 이 메서드도 DataFrame을 입력으로 받지만, 또 다른 DataFrame을 반환하는 대신 모델 객체를 반환해요. 예를 들어 문자열로 저장된 범주형 데이터를 모델에 포함할 수 있게 해 주는 StringIndexerModel이나, 분류 또는 회귀를 위해 랜덤 포레스트 알고리즘을 사용하는 RandomForestModel 등이 있어요.
다음 중 Spark에서의 머신 러닝에 대해 사실이 아닌 것은 무엇일까요?
이 연습은 강의의 일부입니다
