การสร้าง SparkSession
ในแบบฝึกหัดนี้ จะสร้างคลัสเตอร์ Spark แบบ local โดยใช้ core ที่มีอยู่ทั้งหมด แล้วเข้าถึงคลัสเตอร์ผ่านออบเจ็กต์ SparkSession
คลาส SparkSession มีแอตทริบิวต์ builder ซึ่งเป็น instance ของคลาส Builder คลาส Builder มีเมธอดสำคัญ 3 อย่างที่ช่วยให้:
- ระบุตำแหน่งของ master node
- ตั้งชื่อแอปพลิเคชัน (ไม่บังคับ)
- ดึง
SparkSessionที่มีอยู่ หรือสร้างใหม่หากยังไม่มี
คลาส SparkSession มีแอตทริบิวต์ version สำหรับดูเวอร์ชันของ Spark หมายเหตุ: สามารถเข้าถึงเวอร์ชันได้อีกวิธีผ่านแอตทริบิวต์ __version__ บนโมดูล pyspark
ดูข้อมูลเพิ่มเติมเกี่ยวกับ SparkSession ได้ ที่นี่
เมื่อใช้งานคลัสเตอร์เสร็จแล้ว ควรปิดการทำงานเพื่อคืนทรัพยากรให้กระบวนการอื่นนำไปใช้งานต่อได้
หมายเหตุ:
- ลองทบทวนสไลด์จากบทเรียนในแผง Slides ถัดจาก IPython Shell เพื่อประกอบการทำแบบฝึกหัด
- เวอร์ชันของ Spark ในแบบฝึกหัดนี้ อาจไม่ตรงกับ เวอร์ชันที่ใช้ในบทเรียน เนื่องจากแพลตฟอร์มได้รับการอัปเดตเป็นเวอร์ชันที่ใหม่กว่า
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning with PySpark
คำแนะนำการฝึกหัด
- นำเข้าคลาส
SparkSessionจากpyspark.sql - สร้างออบเจ็กต์
SparkSessionที่เชื่อมต่อกับคลัสเตอร์แบบ local โดยใช้ core ทั้งหมดที่มี และตั้งชื่อแอปพลิเคชันว่า'test' - ใช้แอตทริบิวต์
versionบนออบเจ็กต์SparkSessionเพื่อดูเวอร์ชันของ Spark ที่รันอยู่บนคลัสเตอร์ หมายเหตุ: เวอร์ชันอาจแตกต่างจากที่แสดงในการนำเสนอ เนื่องจากมีการอัปเดตเป็นระยะ - ปิดการทำงานของคลัสเตอร์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the SparkSession class
from ____ import ____
# Create SparkSession object
spark = SparkSession.builder \
.master(____) \
.____(____) \
.____()
# What version of Spark?
print(spark.____)
# Terminate the cluster
spark.____()