ブール型の列を設定する
データセットには、本来はブール値として表現するのが最も適切な列が含まれることがあります。しかし、pandas は既定ではそれらを float として読み込むことが多いです。これは、既定をブール型にすると NA 値が True になってしまうなど、望ましくない影響が出る可能性があるためです。
fcc_survey_subset.xlsx には、文字列の ID 列と、経済的なストレス要因を示す複数の True/False 列が含まれています。ここでは、NA が一切ない非 ID 列を特定してブール型にできるかを評価し、その列を dtype 引数で指定して read_excel() にブール型として読み込ませます。
pandas は pd として読み込まれています。
この演習はコースの一部です
pandasで効率よくデータを取り込む
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the data
survey_data = pd.read_excel("fcc_survey_subset.xlsx")
# Count NA values in each column
print(survey_data.____)