เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

RDD จากชุดข้อมูลภายนอก

PySpark สามารถสร้าง RDD จากไฟล์ที่เก็บอยู่บนอุปกรณ์จัดเก็บข้อมูลภายนอกได้อย่างง่ายดาย ไม่ว่าจะเป็น HDFS (Hadoop Distributed File System), Amazon S3 และอื่น ๆ แต่วิธีที่นิยมใช้มากที่สุดคือการสร้าง RDD จากไฟล์ที่อยู่ในระบบไฟล์ภายในเครื่อง วิธีนี้รับพาธของไฟล์และอ่านเนื้อหาเป็นชุดของบรรทัด ในแบบฝึกหัดนี้ จะสร้าง RDD จากพาธของไฟล์ (file_path) ซึ่งชี้ไปยังไฟล์ชื่อ README.md ที่มีอยู่แล้วใน workspace ของคุณ

อย่าลืมว่า SparkContext sc พร้อมใช้งานอยู่แล้วใน workspace

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แสดงค่า file_path ใน PySpark shell
  • สร้าง RDD ชื่อ fileRDD จาก file_path
  • แสดงประเภทของ fileRDD ที่สร้างขึ้น

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
แก้ไขและรันโค้ด