เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การรัน SQL บน DataFrame

ใน PySpark สามารถจัดการ DataFrame ได้อย่างสะดวกด้วยคิวรี SQL โดยเมธอด .sql() ใน SparkSession ช่วยให้รันคิวรี SQL แบบ Programmatic และคืนผลลัพธ์เป็น DataFrame ใหม่ ในแบบฝึกหัดนี้ จะสร้างตารางชั่วคราวจาก DataFrame ที่สร้างไว้ก่อนหน้า จากนั้นเขียนคิวรีเพื่อดึงชื่อของผู้คนจากตารางชั่วคราวนั้น และกำหนดผลลัพธ์ให้กับ DataFrame ใหม่

ในที่นี้มี SparkSession ชื่อ spark และ DataFrame ชื่อ df พร้อมใช้งานในพื้นที่ทำงานของคุณแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างตารางชั่วคราวชื่อ "people" จาก DataFrame df
  • เขียนคิวรีเพื่อดึงชื่อของผู้คนจากตารางชั่วคราว people
  • กำหนดผลลัพธ์ของคิวรีจาก Spark ให้กับ DataFrame ใหม่ชื่อ people_df_names
  • แสดง 10 ชื่อแรกจาก DataFrame people_df_names

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a temporary table "people"
df.____("people")

# Select the names from the temporary table people
query = """SELECT name FROM ____"""

# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)

# Print the top 10 names of the people
people_df_names.____(____)
แก้ไขและรันโค้ด