Optimisasi ukuran berkas
Bayangkan Anda diberi 2 berkas data besar pada sebuah klaster dengan 10 node. Masing-masing berkas berisi 10 juta baris dengan ukuran yang kurang lebih sama. Saat bekerja dengan data, responsnya dapat diterima tetapi pembacaan awal dari berkas memakan waktu cukup lama. Perhatikan bahwa Anda adalah satu-satunya pengguna data ini dan datanya berubah pada setiap proses.
Manakah dari opsi berikut yang terbaik untuk meningkatkan kinerja?
Latihan ini merupakan bagian dari kursus
Membersihkan Data dengan PySpark
Latihan interaktif langsung
Ubah teori menjadi aksi dengan salah satu latihan interaktif kami
Mulai latihan