Inizia subitoInizia gratis

Ottimizzazione della dimensione dei file

Immagina di avere 2 file di dati di grandi dimensioni su un cluster con 10 nodi. Ogni file contiene 10M di righe di dimensioni più o meno uguali. Mentre lavori con i dati, la reattività è accettabile, ma la lettura iniziale dai file richiede un tempo considerevole. Nota che sarai l’unico a usare i dati e che cambiano a ogni esecuzione.

Quale delle seguenti è l’opzione migliore per migliorare le prestazioni?

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

esercizio interattivo pratico

Trasforma la teoria in pratica con uno dei nostri esercizi interattivi

Inizia esercizio