CommencezCommencez gratuitement

Définir des colonnes booléennes

Certains jeux de données comportent des colonnes qui devraient idéalement être représentées par des valeurs booléennes. Cependant, pandas les charge généralement comme des nombres à virgule flottante par défaut, car utiliser des booléens par défaut pourrait avoir des effets indésirables, par exemple convertir des valeurs NA en True.

fcc_survey_subset.xlsx contient une colonne d'identifiant sous forme de chaîne et plusieurs colonnes Vrai/Faux indiquant des facteurs de stress financiers. Vous allez déterminer quelles colonnes non identifiants n'ont aucune valeur NA et peuvent donc être définies comme booléennes, puis indiquer à read_excel() de les charger ainsi avec l'argument dtype.

pandas est importé sous le nom pd.

Cette activité fait partie du cours

Ingestion de données rationalisée avec pandas

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the data
survey_data = pd.read_excel("fcc_survey_subset.xlsx")

# Count NA values in each column
print(survey_data.____)
Modifier et exécuter le code