การปรับขนาดไฟล์ให้เหมาะสม
สมมติว่ามีไฟล์ข้อมูลขนาดใหญ่ 2 ไฟล์บน cluster ที่มี 10 node โดยแต่ละไฟล์มี 10 ล้านแถวที่มีขนาดใกล้เคียงกัน ขณะที่ทำงานกับข้อมูลนี้ การตอบสนองโดยรวมอยู่ในระดับที่รับได้ แต่การอ่านข้อมูลครั้งแรกจากไฟล์ใช้เวลานานมาก ทั้งนี้ คุณเป็นผู้ใช้ข้อมูลเพียงคนเดียว และข้อมูลจะเปลี่ยนในแต่ละครั้งที่รัน
ตัวเลือกใดต่อไปนี้เหมาะสมที่สุดสำหรับการปรับปรุงประสิทธิภาพ?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การทำความสะอาดข้อมูลด้วย PySpark
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด