컬럼 조합하기
데이터 준비의 마지막 단계는 모든 예측 변수 컬럼을 하나의 컬럼으로 통합하는 것입니다.
이전 연습 문제들의 변경 사항이 반영된 업데이트된 flights 데이터에는 다음과 같은 예측 변수 컬럼들이 있습니다:
mon,dom,dowcarrier_idx(carrier에서 인덱싱된 값)org_idx(org에서 인덱싱된 값)kmdepartduration
참고: show() 메서드의 truncate=False 인수를 사용하면 출력 결과에서 데이터가 잘리지 않습니다.
이 연습은 강의의 일부입니다
PySpark로 하는 Machine Learning
연습 안내
- 예측 변수를 조합하는 데 사용할 클래스를 임포트하세요.
- 예측 변수 컬럼들을 하나의 컬럼으로 합칠 수 있는 assembler 객체를 생성하세요.
- assembler를 사용하여 통합된 새 컬럼을 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)