시작하기무료로 시작하기

DataFrame에 SQL로 분석하기

SQL 쿼리는 DataFrame 연산에 비해 간결하고 실행하기 쉽습니다. 하지만 DataFrame에 SQL을 적용하려면 먼저 DataFrame을 테이블처럼 사용할 수 있도록 임시 뷰를 만들고, 그 테이블에 SQL 쿼리를 적용해야 해요.

작업 공간에는 이미 SparkContext sparksalaries_df가 준비되어 있습니다.

이 연습은 강의의 일부입니다

PySpark 입문

강의 보기

연습 안내

  • salaries_df DataFrame에서 임시 테이블 "salaries_table"을(를) 생성하세요.
  • 캐나다("CA")의 company_location에서 "job_title" 열을 추출하는 쿼리를 작성하세요.
  • SQL 쿼리를 적용해 새로운 DataFrame canada_titles를 만드세요.
  • 테이블 요약 정보를 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create a temporary view of salaries_table
salaries_df.____('salaries_table')

# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''

# Apply the SQL "query"
canada_titles = spark.____(____)

# Generate basic statistics
canada_titles.____().show()
코드 편집 및 실행