Kom igångKom igång gratis

Optimering av filstorlek

Tänk dig att du har 2 stora datafiler i ett kluster med 10 noder. Varje fil innehåller 10 miljoner rader av ungefär samma storlek. När du arbetar med datan är svarstiderna acceptabla, men den inledande inläsningen från filerna tar lång tid. Observera att du är den enda som använder datan och att den förändras för varje körning.

Vilket av följande alternativ ger bäst prestanda?

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Interaktiv övning med praktiskt arbete

Gör teori till handling med en av våra interaktiva övningar

Starta övningen