เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

RDD จาก Parallelized Collections

Resilient Distributed Dataset (RDD) คือการ abstraction พื้นฐานใน Spark ซึ่งเป็นชุดข้อมูลแบบกระจายที่ไม่สามารถเปลี่ยนแปลงได้ เนื่องจาก RDD เป็นชนิดข้อมูลหลักและรากฐานสำคัญของ Spark จึงเป็นสิ่งจำเป็นที่ต้องเข้าใจวิธีสร้างมันขึ้นมา ในแบบฝึกหัดนี้ คุณจะสร้าง RDD แรกใน PySpark จากชุดคำศัพท์

โดย SparkContext sc พร้อมใช้งานแล้วใน workspace ของคุณ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง RDD ชื่อ RDD จาก Python list ของคำศัพท์
  • ตรวจสอบว่าออบเจ็กต์ที่สร้างขึ้นเป็น RDD

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
แก้ไขและรันโค้ด