시작하기무료로 시작하기

SQL과 Parquet

Parquet 파일은 Spark에서 SQL 쿼리를 실행할 때 훌륭한 백엔드 데이터 저장소예요. 동일한 쿼리를 Spark의 Python 함수로 직접 실행할 수도 있지만, 때로는 Python 옵션과 함께 SQL 쿼리를 사용하는 편이 더 쉬울 때가 있어요.

이번 예제에서는 지난 연습 문제에서 만든 Parquet 파일을 읽어와 SQL 테이블로 등록하겠습니다. 등록이 끝나면 테이블(즉, Parquet 파일)에 대해 간단한 쿼리를 실행해 볼 거예요.

spark 객체와 AA_DFW_ALL.parquet 파일은 이미 준비되어 있어요.

이 연습은 강의의 일부입니다

PySpark로 데이터 정제하기

강의 보기

연습 안내

  • AA_DFW_ALL.parquet 파일을 flights_df로 불러오세요.
  • createOrReplaceTempView 메서드로 flights 테이블 이름을 할당하세요.
  • flights 테이블에 대해 Spark SQL 쿼리를 실행하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
코드 편집 및 실행