เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

แปลง RDD เป็น DataFrame

เช่นเดียวกับ RDD นั้น DataFrame ใน Spark ก็เป็นโครงสร้างข้อมูลแบบ immutable และกระจายตัว แม้ว่า RDD จะเป็นโครงสร้างข้อมูลพื้นฐานของ Spark แต่การทำงานกับข้อมูลใน DataFrame นั้นสะดวกกว่า ดังนั้นการเข้าใจวิธีแปลง RDD ให้เป็น DataFrame จึงเป็นสิ่งจำเป็น

ในแบบฝึกหัดนี้ จะเริ่มจากการสร้าง RDD จาก sample_list ที่เตรียมไว้ให้แล้ว RDD นี้ประกอบด้วย list ของ tuple ได้แก่ ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) โดยแต่ละ tuple เก็บชื่อและอายุของบุคคล จากนั้นจะสร้าง DataFrame จาก RDD และ schema (ซึ่งเป็น list ของ 'Name' และ 'Age') แล้วยืนยันว่าผลลัพธ์ที่ได้เป็น PySpark DataFrame

โปรดทราบว่า SparkContext sc และ SparkSession spark ถูกเตรียมไว้ใน workspace ให้เรียบร้อยแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง RDD จาก sample_list
  • สร้าง PySpark DataFrame โดยใช้ RDD และ schema ที่สร้างไว้
  • ยืนยันว่าผลลัพธ์ที่ได้เป็น PySpark DataFrame

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
แก้ไขและรันโค้ด