คู่ที่เข้ากันได้อย่างลงตัว
R ช่วยให้เขียนโค้ดวิเคราะห์ข้อมูลได้อย่างรวดเร็ว และหากเขียนได้ดี โค้ดก็จะอ่านง่ายและดูแลรักษาได้ง่ายด้วย ในหลายกรณี R ก็รันโค้ดได้เร็วเพียงพอ
อย่างไรก็ตาม R ต้องโหลดข้อมูลทั้งหมดไว้ในหน่วยความจำ (RAM) บนเครื่องเดียว ซึ่งจำกัดขนาดข้อมูลที่วิเคราะห์ได้ แนวทางแก้ไขมีหลายวิธี หนึ่งในนั้นคือการใช้ Spark
Spark เป็น open source platform สำหรับการประมวลผลแบบคลัสเตอร์ ซึ่งช่วยให้กระจายข้อมูลและการคำนวณไปยังหลายเครื่องพร้อมกัน ทำให้สามารถวิเคราะห์ข้อมูลได้ในปริมาณที่แทบไม่มีขีดจำกัด R และ Spark เสริมกันได้อย่างลงตัว — ใช้ร่วมกันแล้วเขียนโค้ดได้เร็ว และ รันโค้ดได้เร็วด้วย!
sparklyr คือแพ็กเกจ R ที่ช่วยให้เขียนโค้ด R เพื่อทำงานกับข้อมูลบน Spark cluster ได้ โดยมี interface แบบ dplyr ซึ่งหมายความว่าสามารถเขียนโค้ดสไตล์ dplyr ในแบบเดิมได้ ไม่ว่าจะทำงานกับข้อมูลบนเครื่องตัวเองหรือบน Spark cluster
ตะโกนถ้าอยากไปให้เร็วขึ้น!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด