Spark DataFrame을 Pandas로 변환하기
거대한 데이터셋에서 쿼리를 실행해 적당한 크기로 집계했다고 가정해 볼게요.
그런 다음 이 테이블을 pandas 같은 도구로 로컬에서 다루는 것이 더 나을 때가 있습니다. Spark DataFrame은 .toPandas() 메서드로 이를 손쉽게 처리할 수 있어요. Spark DataFrame에서 이 메서드를 호출하면 동일한 pandas DataFrame이 반환됩니다. 정말 간단하죠!
이번에는 SEA와 PDX에서 각 공항으로 가는 항공편 수를 세는 쿼리예요.
워크스페이스에는 이미 spark라는 SparkSession이 준비되어 있다는 점을 기억하세요!
이 연습은 강의의 일부입니다
PySpark 기초
연습 안내
.sql()메서드로 쿼리를 실행하고 결과를flight_counts에 저장하세요.flight_counts에.toPandas()메서드를 사용해pd_counts라는pandasDataFrame을 만드세요.- 콘솔에
pd_counts의.head()를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)