เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การโหลดข้อมูลใน PySpark shell

ใน PySpark เราแสดงการคำนวณผ่านการดำเนินการบน distributed collections ที่ถูกประมวลผลแบบขนานโดยอัตโนมัติทั่วทั้ง cluster ในแบบฝึกหัดก่อนหน้า คุณได้เห็นตัวอย่างการโหลด list เป็น parallelized collections แล้ว และในแบบฝึกหัดนี้ จะได้โหลดข้อมูลจากไฟล์ในเครื่องผ่าน PySpark shell

โดยในพื้นที่ทำงานของคุณมี SparkContext sc และตัวแปร file_path (ซึ่งเป็น path ไปยังไฟล์ README.md) พร้อมใช้งานอยู่แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดไฟล์ข้อความ README.md ในเครื่องผ่าน PySpark shell

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load a local file into PySpark shell
lines = sc.____(file_path)
แก้ไขและรันโค้ด