การโหลดข้อมูลใน PySpark shell
ใน PySpark เราแสดงการคำนวณผ่านการดำเนินการบน distributed collections ที่ถูกประมวลผลแบบขนานโดยอัตโนมัติทั่วทั้ง cluster ในแบบฝึกหัดก่อนหน้า คุณได้เห็นตัวอย่างการโหลด list เป็น parallelized collections แล้ว และในแบบฝึกหัดนี้ จะได้โหลดข้อมูลจากไฟล์ในเครื่องผ่าน PySpark shell
โดยในพื้นที่ทำงานของคุณมี SparkContext sc และตัวแปร file_path (ซึ่งเป็น path ไปยังไฟล์ README.md) พร้อมใช้งานอยู่แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- โหลดไฟล์ข้อความ
README.mdในเครื่องผ่าน PySpark shell
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load a local file into PySpark shell
lines = sc.____(file_path)