欠損・不正なデータをスキップする
この演習では、read_csv() のパラメータを使って、列数より多くの値を含むレコードなど、不正なデータを含むファイルに対処します。既定では、このようなファイルを読み込もうとすると、特定のエラー pandas.errors.ParserError が発生します。
ここにあるバーモント州の税データには、一部壊れている行があります。正常な行だけを読み込むには、エラーをスキップするように pandas に指示する必要があります。また、どの程度データに問題があるか把握できるよう、行をスキップした際には警告も出してほしいです。
pandas は pd としてインポート済みです。演習コードはファイルの読み込みを試みます。pandas.errors.ParserError が発生した場合は、except ブロック内のコードが実行されます。
この演習はコースの一部です
pandasで効率よくデータを取り込む
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
try:
# Import the CSV without any keyword arguments
data = ____
# View first 5 records
print(data.head())
except pd.errors.ParserError:
print("Your data contained rows that could not be parsed.")