CommencezCommencez gratuitement

Définir le schéma

Nous avons chargé des schémas de plusieurs façons jusqu'ici. Définissons maintenant un schéma directement. Nous allons utiliser un dictionnaire de données :

Variable Description
age Âge de la personne
education_num Scolarité (par diplôme)
marital_status État matrimonial
occupation Profession
income Revenu catégoriel

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Spécifiez le schéma des données, en donnant les noms de colonnes (age, education_num, marital_status, occupation et income) et les types de colonnes, et en définissant une virgule pour l'argument sep=.
  • Lisez les données à partir d'un fichier délimité par des virgules nommé adult_reduced_100.csv.
  • Affichez le schéma du DataFrame obtenu.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Modifier et exécuter le code