RDD จากชุดข้อมูลภายนอก
PySpark สามารถสร้าง RDD จากไฟล์ที่เก็บอยู่บนอุปกรณ์จัดเก็บข้อมูลภายนอกได้อย่างง่ายดาย ไม่ว่าจะเป็น HDFS (Hadoop Distributed File System), Amazon S3 และอื่น ๆ แต่วิธีที่นิยมใช้มากที่สุดคือการสร้าง RDD จากไฟล์ที่อยู่ในระบบไฟล์ภายในเครื่อง วิธีนี้รับพาธของไฟล์และอ่านเนื้อหาเป็นชุดของบรรทัด ในแบบฝึกหัดนี้ จะสร้าง RDD จากพาธของไฟล์ (file_path) ซึ่งชี้ไปยังไฟล์ชื่อ README.md ที่มีอยู่แล้วใน workspace ของคุณ
อย่าลืมว่า SparkContext sc พร้อมใช้งานอยู่แล้วใน workspace
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- แสดงค่า
file_pathใน PySpark shell - สร้าง RDD ชื่อ
fileRDDจากfile_path - แสดงประเภทของ
fileRDDที่สร้างขึ้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))