시작하기무료로 시작하기

빠른 파이프라인

더 복잡한 데이터를 파싱하기 전에, 관리자님이 기본 단계를 포함한 간단한 파이프라인 예시를 보고 싶어 하십니다. 이 예시에서는 데이터 파일을 읽어 들이고, 몇 개의 행을 필터링하고, ID 열을 추가한 다음, JSON 데이터로 저장해 보겠습니다.

spark 컨텍스트가 정의되어 있으며, 관례대로 pyspark.sql.functions 라이브러리는 F로 별칭을 붙여 두었습니다.

이 연습은 강의의 일부입니다

PySpark로 데이터 정제하기

강의 보기

연습 안내

  • 파일 2015-departures.csv.gz를 DataFrame으로 가져오세요. 헤더는 이미 정의되어 있습니다.
  • DataFrame을 0분을 초과하는 비행만 포함하도록 필터링하세요. 열 이름이 아니라 열의 인덱스를 사용하세요 (.printSchema()로 열 이름/순서를 확인할 수 있음).
  • ID 열을 추가하세요.
  • 파일을 output.json이라는 JSON 문서로 저장하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the data to a DataFrame
departures_df = spark.____(____, header=____)

# Remove any duration of 0
departures_df = departures_df.____(____)

# Add an ID column
departures_df = departures_df.____('id', ____)

# Write the file out to JSON format
____.write.____(____, mode='overwrite')
코드 편집 및 실행