Mulai sekarangMulai gratis

Optimisasi ukuran berkas

Bayangkan Anda diberi 2 berkas data besar pada sebuah klaster dengan 10 node. Masing-masing berkas berisi 10 juta baris dengan ukuran yang kurang lebih sama. Saat bekerja dengan data, responsnya dapat diterima tetapi pembacaan awal dari berkas memakan waktu cukup lama. Perhatikan bahwa Anda adalah satu-satunya pengguna data ini dan datanya berubah pada setiap proses.

Manakah dari opsi berikut yang terbaik untuk meningkatkan kinerja?

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Latihan interaktif langsung

Ubah teori menjadi aksi dengan salah satu latihan interaktif kami

Mulai latihan