시작하기무료로 시작하기

컬럼 조합하기

데이터 준비의 마지막 단계는 모든 예측 변수 컬럼을 하나의 컬럼으로 통합하는 것입니다.

이전 연습 문제들의 변경 사항이 반영된 업데이트된 flights 데이터에는 다음과 같은 예측 변수 컬럼들이 있습니다:

  • mon, dom, dow
  • carrier_idx (carrier에서 인덱싱된 값)
  • org_idx (org에서 인덱싱된 값)
  • km
  • depart
  • duration

참고: show() 메서드의 truncate=False 인수를 사용하면 출력 결과에서 데이터가 잘리지 않습니다.

이 연습은 강의의 일부입니다

PySpark로 하는 Machine Learning

강의 보기

연습 안내

  • 예측 변수를 조합하는 데 사용할 클래스를 임포트하세요.
  • 예측 변수 컬럼들을 하나의 컬럼으로 합칠 수 있는 assembler 객체를 생성하세요.
  • assembler를 사용하여 통합된 새 컬럼을 만드세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
코드 편집 및 실행