시작하기무료로 시작하기

쿼리가 궁금하신가요?

DataFrame 인터페이스의 장점 중 하나는 Spark 클러스터의 테이블에 대해 SQL 쿼리를 실행할 수 있다는 점입니다. SQL이 처음이셔도 걱정하지 마세요. 쿼리는 저희가 제공해 드립니다! (SQL을 더 배우고 싶다면 Introduction to SQL 강좌부터 시작해 보세요.)

이전 연습 문제에서 보셨듯, 클러스터에는 flights 테이블이 있습니다. 이 테이블에는 2014년과 2015년에 Portland International Airport(PDX) 또는 Seattle-Tacoma International Airport(SEA)에서 출발한 모든 항공편이 행 하나씩으로 들어 있습니다.

이 테이블에 쿼리를 실행하는 방법은 SparkSession.sql() 메서드를 사용하는 것만큼 간단합니다. 이 메서드는 쿼리를 담은 문자열을 받아 결과를 담은 DataFrame을 반환해요!

자세히 보면, 쿼리에서만 flights 테이블이 언급되고 어떤 메서드의 인수로는 전달되지 않습니다. 이는 현재 환경에 그 데이터를 담고 있는 로컬 객체가 없기 때문에 테이블을 인수로 넘기는 것이 의미가 없기 때문입니다.

워크스페이스에는 이미 spark라는 SparkSession이 생성되어 있습니다. (여러분을 위해 미리 만들어 두었기 때문에 더 이상 my_spark라고 부르지 않아요!)

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

연습 안내

  • .sql() 메서드를 사용해 flights 테이블의 처음 10개 행을 가져와 flights10에 저장하세요. 적절한 SQL 쿼리는 변수 query에 들어 있습니다.
  • DataFrame 메서드 .show()를 사용해 flights10을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Don't change this query
query = "FROM flights SELECT * LIMIT 10"

# Get the first 10 rows of flights
flights10 = ____

# Show the results
flights10.____
코드 편집 및 실행