Optimizarea dimensiunii fișierelor
Imaginează-ți că ai 2 fișiere de date mari pe un cluster cu 10 noduri. Fiecare fișier conține 10 milioane de rânduri de dimensiuni aproximativ egale. În timp ce lucrezi cu datele, viteza de răspuns este acceptabilă, însă citirea inițială a fișierelor durează considerabil. Reține că ești singurul utilizator al acestor date și că ele se schimbă la fiecare rulare.
Care dintre următoarele opțiuni este cea mai bună pentru a îmbunătăți performanța?
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul