Définir des colonnes booléennes
Certains jeux de données comportent des colonnes qui devraient idéalement être représentées par des valeurs booléennes. Cependant, pandas les charge généralement comme des nombres à virgule flottante par défaut, car utiliser des booléens par défaut pourrait avoir des effets indésirables, par exemple convertir des valeurs NA en True.
fcc_survey_subset.xlsx contient une colonne d'identifiant sous forme de chaîne et plusieurs colonnes Vrai/Faux indiquant des facteurs de stress financiers. Vous allez déterminer quelles colonnes non identifiants n'ont aucune valeur NA et peuvent donc être définies comme booléennes, puis indiquer à read_excel() de les charger ainsi avec l'argument dtype.
pandas est importé sous le nom pd.
Cette activité fait partie du cours
Ingestion de données rationalisée avec pandas
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the data
survey_data = pd.read_excel("fcc_survey_subset.xlsx")
# Count NA values in each column
print(survey_data.____)