ÎncepețiÎncepe gratuit

Optimizarea dimensiunii fișierelor

Imaginează-ți că ai 2 fișiere de date mari pe un cluster cu 10 noduri. Fiecare fișier conține 10 milioane de rânduri de dimensiuni aproximativ egale. În timp ce lucrezi cu datele, viteza de răspuns este acceptabilă, însă citirea inițială a fișierelor durează considerabil. Reține că ești singurul utilizator al acestor date și că ele se schimbă la fiecare rulare.

Care dintre următoarele opțiuni este cea mai bună pentru a îmbunătăți performanța?

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul