Charger des données de recensement
Commençons par créer votre premier DataFrame PySpark ! Le fichier adult_reduced.csv contient un regroupement d'adultes selon diverses catégories démographiques. Ces données ont été adaptées du recensement des États‑Unis. On y compte un total de 32 562 regroupements d'adultes.
Nous allons charger le fichier CSV et examiner le schéma obtenu.
Dictionnaire des données :
| Variable | Description |
|---|---|
| age | Âge de la personne |
| education_num | Scolarité (par diplôme) |
| marital_status | État matrimonial |
| occupation | Profession |
| income | Revenu (variable catégorielle) |
Cette activité fait partie du cours
Introduction à PySpark
Instructions de l’exercice
- Créez un DataFrame PySpark à partir du fichier
"adult_reduced.csv"à l'aide de la méthodespark.read.csv(). - Affichez le DataFrame obtenu.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____