เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้าง SparkSession

ในแบบฝึกหัดนี้ จะสร้างคลัสเตอร์ Spark แบบ local โดยใช้ core ที่มีอยู่ทั้งหมด แล้วเข้าถึงคลัสเตอร์ผ่านออบเจ็กต์ SparkSession

คลาส SparkSession มีแอตทริบิวต์ builder ซึ่งเป็น instance ของคลาส Builder คลาส Builder มีเมธอดสำคัญ 3 อย่างที่ช่วยให้:

  • ระบุตำแหน่งของ master node
  • ตั้งชื่อแอปพลิเคชัน (ไม่บังคับ)
  • ดึง SparkSession ที่มีอยู่ หรือสร้างใหม่หากยังไม่มี

คลาส SparkSession มีแอตทริบิวต์ version สำหรับดูเวอร์ชันของ Spark หมายเหตุ: สามารถเข้าถึงเวอร์ชันได้อีกวิธีผ่านแอตทริบิวต์ __version__ บนโมดูล pyspark

ดูข้อมูลเพิ่มเติมเกี่ยวกับ SparkSession ได้ ที่นี่

เมื่อใช้งานคลัสเตอร์เสร็จแล้ว ควรปิดการทำงานเพื่อคืนทรัพยากรให้กระบวนการอื่นนำไปใช้งานต่อได้

หมายเหตุ:

  1. ลองทบทวนสไลด์จากบทเรียนในแผง Slides ถัดจาก IPython Shell เพื่อประกอบการทำแบบฝึกหัด
  2. เวอร์ชันของ Spark ในแบบฝึกหัดนี้ อาจไม่ตรงกับ เวอร์ชันที่ใช้ในบทเรียน เนื่องจากแพลตฟอร์มได้รับการอัปเดตเป็นเวอร์ชันที่ใหม่กว่า

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าคลาส SparkSession จาก pyspark.sql
  • สร้างออบเจ็กต์ SparkSession ที่เชื่อมต่อกับคลัสเตอร์แบบ local โดยใช้ core ทั้งหมดที่มี และตั้งชื่อแอปพลิเคชันว่า 'test'
  • ใช้แอตทริบิวต์ version บนออบเจ็กต์ SparkSession เพื่อดูเวอร์ชันของ Spark ที่รันอยู่บนคลัสเตอร์ หมายเหตุ: เวอร์ชันอาจแตกต่างจากที่แสดงในการนำเสนอ เนื่องจากมีการอัปเดตเป็นระยะ
  • ปิดการทำงานของคลัสเตอร์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the SparkSession class
from ____ import ____

# Create SparkSession object
spark = SparkSession.builder \
                    .master(____) \
                    .____(____) \
                    .____()

# What version of Spark?
print(spark.____)

# Terminate the cluster
spark.____()
แก้ไขและรันโค้ด