Map และ Collect
เมธอดหลักที่ใช้จัดการข้อมูลใน PySpark คือ map() โดย transformation map() รับฟังก์ชันเป็นอาร์กิวเมนต์แล้วนำไปใช้กับแต่ละ element ใน RDD ซึ่งสามารถทำได้หลากหลาย ตั้งแต่การดึงเว็บไซต์ที่สอดคล้องกับ URL แต่ละรายการ ไปจนถึงการยกกำลังสองของตัวเลข ในแบบฝึกหัดนี้ จะใช้ transformation map() เพื่อยกกำลังสามของตัวเลขทุกตัวใน RDD ชื่อ numbRDD ที่สร้างไว้ก่อนหน้านี้ จากนั้นเก็บ element ทั้งหมดไว้ในตัวแปร แล้วแสดงผลลัพธ์
ในขณะนี้มี SparkContext sc และ numbRDD พร้อมใช้งานใน workspace ของคุณแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- สร้าง transformation
map()เพื่อยกกำลังสามของตัวเลขทุกตัวในnumbRDD - เก็บผลลัพธ์ไว้ในตัวแปร
numbers_all - แสดงผลลัพธ์จากตัวแปร
numbers_all
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)