欠損値を置き換える
前の演習では、大学データセットを分析し、データ内で '.' が欠損値を表していることを確認しました。この演習では、pandas モジュールを使ってそのような値を最適に処理する方法を学びます。
pandas の read_csv() 関数を使い、DataFrame の欠損値を指定できる na_values 引数を調整して、CSV ファイルを読み込む際の処理方法を学びます。
データセットは college.csv として用意されています。pandas と numpy はそれぞれ pd と np の名前で既にインポート済みです。
この演習はコースの一部です
Pythonで欠損データに対処する
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Read the dataset 'college.csv' with na_values set to '.'
college = pd.read_csv(___, ___)
print(college.head())