เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้าง RDD

ใน PySpark มีหลายวิธีในการสร้าง RDD (Resilient Distributed Dataset) เนื่องจากคุณคุ้นเคยกับ DataFrame อยู่แล้ว เราจะสร้าง RDD จาก DataFrame ในแบบฝึกหัดนี้ จำไว้ว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่ใน workspace ของคุณแล้ว!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง DataFrame จากลิสต์ที่กำหนดให้ โดยตั้งชื่อว่า df
  • แปลง DataFrame ให้เป็น RDD
  • เรียกข้อมูลจาก RDD ด้วย collect แล้วพิมพ์ผลลัพธ์ที่ได้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)

# Convert DataFrame to RDD
rdd = df.____

# Show the RDD's contents
rdd.____
print(rdd)
แก้ไขและรันโค้ด