DataFrame에 SQL로 분석하기
SQL 쿼리는 DataFrame 연산에 비해 간결하고 실행하기 쉽습니다. 하지만 DataFrame에 SQL을 적용하려면 먼저 DataFrame을 테이블처럼 사용할 수 있도록 임시 뷰를 만들고, 그 테이블에 SQL 쿼리를 적용해야 해요.
작업 공간에는 이미 SparkContext spark와 salaries_df가 준비되어 있습니다.
이 연습은 강의의 일부입니다
PySpark 입문
연습 안내
salaries_dfDataFrame에서 임시 테이블"salaries_table"을(를) 생성하세요.- 캐나다(
"CA")의company_location에서 "job_title" 열을 추출하는 쿼리를 작성하세요. - SQL 쿼리를 적용해 새로운 DataFrame
canada_titles를 만드세요. - 테이블 요약 정보를 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a temporary view of salaries_table
salaries_df.____('salaries_table')
# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''
# Apply the SQL "query"
canada_titles = spark.____(____)
# Generate basic statistics
canada_titles.____().show()