CommencezCommencez gratuitement

Charger des données de recensement

Commençons par créer votre premier DataFrame PySpark ! Le fichier adult_reduced.csv contient un regroupement d'adultes selon diverses catégories démographiques. Ces données ont été adaptées du recensement des États‑Unis. On y compte un total de 32 562 regroupements d'adultes.

Nous allons charger le fichier CSV et examiner le schéma obtenu.

Dictionnaire des données :

Variable Description
age Âge de la personne
education_num Scolarité (par diplôme)
marital_status État matrimonial
occupation Profession
income Revenu (variable catégorielle)

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Créez un DataFrame PySpark à partir du fichier "adult_reduced.csv" à l'aide de la méthode spark.read.csv().
  • Affichez le DataFrame obtenu.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Read in the CSV
census_adult = ____.____.____(____)

# Show the DataFrame
census_adult.____
Modifier et exécuter le code