Optimering av filstorlek
Tänk dig att du har 2 stora datafiler i ett kluster med 10 noder. Varje fil innehåller 10 miljoner rader av ungefär samma storlek. När du arbetar med datan är svarstiderna acceptabla, men den inledande inläsningen från filerna tar lång tid. Observera att du är den enda som använder datan och att den förändras för varje körning.
Vilket av följande alternativ ger bäst prestanda?
Den här övningen är en del av kursen
Datarensning med PySpark
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen