เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การปรับขนาดไฟล์ให้เหมาะสม

สมมติว่ามีไฟล์ข้อมูลขนาดใหญ่ 2 ไฟล์บน cluster ที่มี 10 node โดยแต่ละไฟล์มี 10 ล้านแถวที่มีขนาดใกล้เคียงกัน ขณะที่ทำงานกับข้อมูลนี้ การตอบสนองโดยรวมอยู่ในระดับที่รับได้ แต่การอ่านข้อมูลครั้งแรกจากไฟล์ใช้เวลานานมาก ทั้งนี้ คุณเป็นผู้ใช้ข้อมูลเพียงคนเดียว และข้อมูลจะเปลี่ยนในแต่ละครั้งที่รัน

ตัวเลือกใดต่อไปนี้เหมาะสมที่สุดสำหรับการปรับปรุงประสิทธิภาพ?

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลด้วย PySpark

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง

เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา

เริ่มแบบฝึกหัด