始める無料で始める

破損データを取り除く

変換フェーズで繰り返し行うステップの1つに、不完全なデータのクリーンアップがあります。この演習では、次の形式のコースデータを確認します。

course_id title description programming_language
1 Some Course r

この DataFrame を点検し、pandas の DataFrame メソッド .isnull().sum() を使って、欠損値がないことを確認します。programming_language 列には欠損があることが分かります。

そこで、.fillna() メソッドを使って欠損値を埋めるように、transform_fill_programming_language() 関数を完成させます。

この演習はコースの一部です

データエンジニアリング入門

コースを見る

演習の手順

  • course_data の欠損値の数を出力してください。
  • programming_language の欠損値は言語 "R" で埋めてください。
  • 今度は transformed に対して、列ごとの欠損値の数をもう一度出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
コードを編集して実行