วิเคราะห์ข้อมูลด้วย SQL บน DataFrame
คิวรี SQL นั้นกระชับและใช้งานง่ายกว่าการดำเนินการบน DataFrame โดยตรง แต่ก่อนที่จะใช้คิวรี SQL กับ DataFrame ได้ คุณต้องสร้าง temporary view ของ DataFrame เป็นตารางก่อน แล้วจึงรันคิวรี SQL บนตารางนั้น
ใน workspace มี SparkContext ชื่อ spark และ salaries_df พร้อมใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- สร้างตารางชั่วคราวชื่อ
"salaries_table"จาก DataFramesalaries_df - สร้างคิวรีเพื่อดึงคอลัมน์ "job_title" จากแถวที่
company_locationเป็นแคนาดา ("CA") - รันคิวรี SQL และสร้าง DataFrame ใหม่ชื่อ
canada_titles - แสดงสรุปข้อมูลของตาราง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a temporary view of salaries_table
salaries_df.____('salaries_table')
# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''
# Apply the SQL "query"
canada_titles = spark.____(____)
# Generate basic statistics
canada_titles.____().show()