RDD จาก Parallelized Collections
Resilient Distributed Dataset (RDD) คือการ abstraction พื้นฐานใน Spark ซึ่งเป็นชุดข้อมูลแบบกระจายที่ไม่สามารถเปลี่ยนแปลงได้ เนื่องจาก RDD เป็นชนิดข้อมูลหลักและรากฐานสำคัญของ Spark จึงเป็นสิ่งจำเป็นที่ต้องเข้าใจวิธีสร้างมันขึ้นมา ในแบบฝึกหัดนี้ คุณจะสร้าง RDD แรกใน PySpark จากชุดคำศัพท์
โดย SparkContext sc พร้อมใช้งานแล้วใน workspace ของคุณ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- สร้าง RDD ชื่อ
RDDจาก Python list ของคำศัพท์ - ตรวจสอบว่าออบเจ็กต์ที่สร้างขึ้นเป็น RDD
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))