or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
บทนี้จะแนะนำโลกของ Big Data พร้อมทั้งแนวคิดและ framework ต่าง ๆ ที่ใช้ในการประมวลผล Big Data รวมถึงเหตุผลที่ Apache Spark ได้รับการยอมรับว่าเป็น framework ที่ดีที่สุดสำหรับ Big Data
abstraction หลักที่ Spark มอบให้คือ resilient distributed dataset (RDD) ซึ่งเป็นชนิดข้อมูลพื้นฐานและหัวใจสำคัญของ engine นี้ บทนี้จะแนะนำ RDD และแสดงวิธีสร้างและรัน RDD ผ่าน RDD Transformations และ Actions
ในบทนี้ จะได้เรียนรู้เกี่ยวกับ Spark SQL ซึ่งเป็นโมดูลของ Spark สำหรับการประมวลผลข้อมูลแบบมีโครงสร้าง โดยมี abstraction สำหรับการเขียนโปรแกรมที่เรียกว่า DataFrames และยังทำหน้าที่เป็น distributed SQL query engine ได้ด้วย บทนี้แสดงให้เห็นว่า Spark SQL ช่วยให้ใช้งาน DataFrames ใน Python ได้อย่างไร
PySpark MLlib คือไลบรารีการเรียนรู้ของเครื่องที่รองรับการขยายขนาดของ Apache Spark ใน Python ประกอบด้วยอัลกอริทึมและเครื่องมือการเรียนรู้ที่ใช้กันทั่วไป ตลอดบทสุดท้ายนี้ จะได้เรียนรู้อัลกอริทึม Machine Learning ที่สำคัญ พร้อมสร้างระบบแนะนำภาพยนตร์และตัวกรองสแปม รวมถึงนำ k-means clustering มาใช้งาน
แบบฝึกหัดปัจจุบัน