CommencerCommencez gratuitement

Types de données

Bon travail ! Avant de commencer la modélisation, il est important de noter que Spark ne traite que les données numériques. Cela signifie que toutes les colonnes de votre DataFrame doivent être soit des entiers, soit des décimales (appelées « doubles » dans Spark).

Lorsque nous avons importé nos données, nous avons laissé Spark déterminer le type d'informations contenues dans chaque colonne. Malheureusement, Spark ne devine pas toujours correctement et vous pouvez constater que certaines colonnes de notre DataFrame contiennent des chaînes représentant des nombres plutôt que des valeurs numériques réelles.

Pour remédier à cela, vous pouvez utiliser la méthode .cast() en combinaison avec la méthode .withColumn(). Il est important de noter que .cast() fonctionne sur les colonnes, tandis que .withColumn() fonctionne sur les DataFrames.

Le seul argument que vous devez transmettre à .cast() est le type de valeur que vous souhaitez créer, sous forme de chaîne. Par exemple, pour créer des nombres entiers, veuillez passer l'argument "integer" et pour les nombres décimaux, veuillez utiliser "double".

Vous pouvez intégrer cet appel à .cast() dans un appel à .withColumn() afin de remplacer la colonne existante, comme vous l'avez fait dans le chapitre précédent.

Quels types de données sont nécessaires à Spark pour la modélisation ?

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Exercice interactif pratique

Transformez la théorie en action avec l’un de nos exercices interactifs

Commencer l’exercice