Nastavení Boolean sloupců
Některé sloupce v datových sadách je nejpřesnější modelovat jako Boolean hodnoty. pandas je ale standardně načítá jako floaty, protože automatické převedení na Boolean by mohlo mít nežádoucí efekty – například by NA hodnoty byly považovány za True.
Soubor fcc_survey_subset.xlsx obsahuje sloupec s ID ve formátu řetězce a několik sloupců True/False označujících finanční zátěž. Zjistíš, které sloupce mimo ID neobsahují žádné NA hodnoty, a tedy je lze nastavit jako Boolean, a pak read_excel() pomocí argumentu dtype řekneš, aby je tak načetla.
pandas je načtený jako pd.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the data
survey_data = pd.read_excel("fcc_survey_subset.xlsx")
# Count NA values in each column
print(survey_data.____)