การสร้าง RDD
ใน PySpark มีหลายวิธีในการสร้าง RDD (Resilient Distributed Dataset) เนื่องจากคุณคุ้นเคยกับ DataFrame อยู่แล้ว เราจะสร้าง RDD จาก DataFrame ในแบบฝึกหัดนี้ จำไว้ว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่ใน workspace ของคุณแล้ว!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- สร้าง DataFrame จากลิสต์ที่กำหนดให้ โดยตั้งชื่อว่า
df - แปลง DataFrame ให้เป็น RDD
- เรียกข้อมูลจาก RDD ด้วย collect แล้วพิมพ์ผลลัพธ์ที่ได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)
# Convert DataFrame to RDD
rdd = df.____
# Show the RDD's contents
rdd.____
print(rdd)