Ottimizzazione della dimensione dei file
Immagina di avere 2 file di dati di grandi dimensioni su un cluster con 10 nodi. Ogni file contiene 10M di righe di dimensioni più o meno uguali. Mentre lavori con i dati, la reattività è accettabile, ma la lettura iniziale dai file richiede un tempo considerevole. Nota che sarai l’unico a usare i dati e che cambiano a ogni esecuzione.
Quale delle seguenti è l’opzione migliore per migliorare le prestazioni?
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
esercizio interattivo pratico
Trasforma la teoria in pratica con uno dei nostri esercizi interattivi
Inizia esercizio