Optimisation de la taille des fichiers
Supposons que vous receviez 2 gros fichiers de données sur un grappe de 10 nœuds. Chaque fichier contient 10 M de lignes d'à peu près la même taille. Quand vous travaillez avec vos données, la réactivité est acceptable, mais la lecture initiale des fichiers prend beaucoup de temps. Notez que vous êtes la seule personne à utiliser ces données et qu'elles changent à chaque exécution.
Laquelle des options suivantes est la meilleure pour améliorer la performance?
Cette activité fait partie du cours
Nettoyer des données avec PySpark
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice