เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้ Spark ใน Python

ขั้นตอนแรกในการใช้ Spark คือการเชื่อมต่อกับ cluster

ในทางปฏิบัติ cluster มักจะทำงานบนเครื่องระยะไกลที่เชื่อมต่อกับโหนดทั้งหมด โดยจะมีเครื่องหนึ่งที่เรียกว่า master ซึ่งทำหน้าที่จัดการการแบ่งข้อมูลและการคำนวณ master จะเชื่อมต่อกับเครื่องอื่น ๆ ใน cluster ซึ่งเรียกว่า worker โดย master จะส่งข้อมูลและงานคำนวณให้ worker แล้ว worker ก็จะส่งผลลัพธ์กลับมา

สำหรับผู้เริ่มต้น การรัน cluster บนเครื่องท้องถิ่นเป็นวิธีที่ง่ายกว่า ในคอร์สนี้จึงไม่ได้เชื่อมต่อกับเครื่องภายนอก แต่จะรันการคำนวณทั้งหมดบนเซิร์ฟเวอร์ของ DataCamp ในรูปแบบ cluster จำลองแทน

การสร้างการเชื่อมต่อทำได้ง่าย ๆ เพียงสร้าง instance ของคลาส SparkContext โดย constructor ของคลาสนี้รับอาร์กิวเมนต์เสริมหลายตัวที่ใช้กำหนดคุณสมบัติของ cluster ที่ต้องการเชื่อมต่อ

สามารถสร้างออบเจ็กต์ที่เก็บคุณสมบัติเหล่านี้ได้ด้วย constructor ของ SparkConf() ดูรายละเอียดทั้งหมดได้ที่ เอกสารอ้างอิง

ตลอดคอร์สนี้ จะมี SparkContext ชื่อ sc พร้อมใช้งานอยู่แล้วใน workspace

จะเชื่อมต่อกับ Spark cluster จาก PySpark ได้อย่างไร?

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐาน PySpark

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง

เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา

เริ่มแบบฝึกหัด