แปลง RDD เป็น DataFrame
เช่นเดียวกับ RDD นั้น DataFrame ใน Spark ก็เป็นโครงสร้างข้อมูลแบบ immutable และกระจายตัว แม้ว่า RDD จะเป็นโครงสร้างข้อมูลพื้นฐานของ Spark แต่การทำงานกับข้อมูลใน DataFrame นั้นสะดวกกว่า ดังนั้นการเข้าใจวิธีแปลง RDD ให้เป็น DataFrame จึงเป็นสิ่งจำเป็น
ในแบบฝึกหัดนี้ จะเริ่มจากการสร้าง RDD จาก sample_list ที่เตรียมไว้ให้แล้ว RDD นี้ประกอบด้วย list ของ tuple ได้แก่ ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) โดยแต่ละ tuple เก็บชื่อและอายุของบุคคล จากนั้นจะสร้าง DataFrame จาก RDD และ schema (ซึ่งเป็น list ของ 'Name' และ 'Age') แล้วยืนยันว่าผลลัพธ์ที่ได้เป็น PySpark DataFrame
โปรดทราบว่า SparkContext sc และ SparkSession spark ถูกเตรียมไว้ใน workspace ให้เรียบร้อยแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- สร้าง RDD จาก
sample_list - สร้าง PySpark DataFrame โดยใช้ RDD และ schema ที่สร้างไว้
- ยืนยันว่าผลลัพธ์ที่ได้เป็น PySpark DataFrame
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create an RDD from the list
rdd = sc.____(sample_list)
# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])
# Check the type of names_df
print("The type of names_df is", ____(names_df))