破損データを取り除く
変換フェーズで繰り返し行うステップの1つに、不完全なデータのクリーンアップがあります。この演習では、次の形式のコースデータを確認します。
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
この DataFrame を点検し、pandas の DataFrame メソッド .isnull().sum() を使って、欠損値がないことを確認します。programming_language 列には欠損があることが分かります。
そこで、.fillna() メソッドを使って欠損値を埋めるように、transform_fill_programming_language() 関数を完成させます。
この演習はコースの一部です
データエンジニアリング入門
演習の手順
course_dataの欠損値の数を出力してください。programming_languageの欠損値は言語 "R" で埋めてください。- 今度は
transformedに対して、列ごとの欠損値の数をもう一度出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)