파이프라인 만들기
드디어 Pipeline을 만들 준비가 되었어요!
Pipeline은 pyspark.ml 모듈의 클래스로, 지금까지 만든 모든 Estimators와 Transformers를 하나로 묶어 줍니다. 이렇게 하면 하나의 간단한 객체로 모델링 과정을 감싸서, 같은 절차를 계속 재사용할 수 있어요. 꽤 편리하죠?
이 연습은 강의의 일부입니다
PySpark 기초
연습 안내
pyspark.ml에서Pipeline을 import하세요.- 키워드 인자
stages와 함께Pipeline()생성자를 호출해flights_pipe라는Pipeline을 만드세요.stages에는 파이프라인에서 데이터가 거칠 모든 단계를 담은 리스트가 들어가야 해요. 여기서는 다음과 같습니다:[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)