การใช้งาน DataFrame
โครงสร้างข้อมูลหลักของ Spark คือ Resilient Distributed Dataset (RDD) ซึ่งเป็น object ระดับต่ำที่ช่วยให้ Spark กระจายข้อมูลไปยังหลาย node ในคลัสเตอร์ได้ อย่างไรก็ตาม RDD นั้นใช้งานโดยตรงได้ค่อนข้างยาก ในคอร์สนี้จึงจะใช้ Spark DataFrame ซึ่งเป็น abstraction ที่สร้างขึ้นบน RDD แทน
Spark DataFrame ถูกออกแบบมาให้ทำงานคล้ายกับตาราง SQL (ตารางที่มีตัวแปรในคอลัมน์และข้อมูลแต่ละแถวในแถว) นอกจากจะเข้าใจง่ายกว่าแล้ว DataFrame ยังได้รับการปรับแต่งให้รองรับการทำงานที่ซับซ้อนได้ดีกว่า RDD อีกด้วย
เมื่อเริ่มแก้ไขและรวมคอลัมน์หรือแถวข้อมูล มักมีหลายวิธีที่ให้ผลลัพธ์เหมือนกัน แต่บางวิธีใช้เวลานานกว่ามาก เมื่อใช้ RDD นักวิทยาศาสตร์ข้อมูลต้องหาวิธีปรับ query ให้เหมาะสมเอง แต่ DataFrame มีการปรับแต่งส่วนนี้ไว้ในตัวแล้ว
ในการเริ่มใช้งาน Spark DataFrame ต้องสร้าง object SparkSession จาก SparkContext ก่อน โดยอาจมองว่า SparkContext คือการเชื่อมต่อกับคลัสเตอร์ และ SparkSession คืออินเทอร์เฟซสำหรับใช้งานการเชื่อมต่อนั้น
จำไว้ว่าตลอดคอร์สนี้จะมี SparkSession ชื่อ spark พร้อมใช้งานใน workspace ของคุณเสมอ!
ข้อใดต่อไปนี้คือข้อได้เปรียบของ Spark DataFrame เมื่อเทียบกับ RDD?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด