시작하기무료로 시작하기

Spark DataFrame을 Pandas로 변환하기

거대한 데이터셋에서 쿼리를 실행해 적당한 크기로 집계했다고 가정해 볼게요.

그런 다음 이 테이블을 pandas 같은 도구로 로컬에서 다루는 것이 더 나을 때가 있습니다. Spark DataFrame은 .toPandas() 메서드로 이를 손쉽게 처리할 수 있어요. Spark DataFrame에서 이 메서드를 호출하면 동일한 pandas DataFrame이 반환됩니다. 정말 간단하죠!

이번에는 SEA와 PDX에서 각 공항으로 가는 항공편 수를 세는 쿼리예요.

워크스페이스에는 이미 spark라는 SparkSession이 준비되어 있다는 점을 기억하세요!

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

연습 안내

  • .sql() 메서드로 쿼리를 실행하고 결과를 flight_counts에 저장하세요.
  • flight_counts.toPandas() 메서드를 사용해 pd_counts라는 pandas DataFrame을 만드세요.
  • 콘솔에 pd_counts.head()를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
코드 편집 및 실행