การใช้ Spark ใน Python
ขั้นตอนแรกในการใช้ Spark คือการเชื่อมต่อกับ cluster
ในทางปฏิบัติ cluster มักจะทำงานบนเครื่องระยะไกลที่เชื่อมต่อกับโหนดทั้งหมด โดยจะมีเครื่องหนึ่งที่เรียกว่า master ซึ่งทำหน้าที่จัดการการแบ่งข้อมูลและการคำนวณ master จะเชื่อมต่อกับเครื่องอื่น ๆ ใน cluster ซึ่งเรียกว่า worker โดย master จะส่งข้อมูลและงานคำนวณให้ worker แล้ว worker ก็จะส่งผลลัพธ์กลับมา
สำหรับผู้เริ่มต้น การรัน cluster บนเครื่องท้องถิ่นเป็นวิธีที่ง่ายกว่า ในคอร์สนี้จึงไม่ได้เชื่อมต่อกับเครื่องภายนอก แต่จะรันการคำนวณทั้งหมดบนเซิร์ฟเวอร์ของ DataCamp ในรูปแบบ cluster จำลองแทน
การสร้างการเชื่อมต่อทำได้ง่าย ๆ เพียงสร้าง instance ของคลาส SparkContext โดย constructor ของคลาสนี้รับอาร์กิวเมนต์เสริมหลายตัวที่ใช้กำหนดคุณสมบัติของ cluster ที่ต้องการเชื่อมต่อ
สามารถสร้างออบเจ็กต์ที่เก็บคุณสมบัติเหล่านี้ได้ด้วย constructor ของ SparkConf() ดูรายละเอียดทั้งหมดได้ที่ เอกสารอ้างอิง
ตลอดคอร์สนี้ จะมี SparkContext ชื่อ sc พร้อมใช้งานอยู่แล้วใน workspace
จะเชื่อมต่อกับ Spark cluster จาก PySpark ได้อย่างไร?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด