始める無料で始める

データ読み込みの検証

毎月新しいファイルを受け取るとしましょう。レコード数と列数は想定されています。この演習では、読み込んだファイルを検証する関数を作成します。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • データ検証用の関数 check_load() を作成します。引数は、データフレーム df、レコード数 num_records、列数 num_columns です。
  • num_records を使って、入力データフレーム dfcount() が同じ数かどうかをチェックします。
  • 入力データフレームの列数を、columns に対して len() を使って測り、num_columns と比較します。
  • これらのチェックがどちらも True であれば、Validation Passed と出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

def ____(____, ____, ____):
  # Takes a dataframe and compares record and column counts to input
  # Message to return if the critera below aren't met
  message = 'Validation Failed'
  # Check number of records
  if num_records == df.____():
    # Check number of columns
    if num_columns == ____(df.____):
      # Success message
      message = ____
  return message

# Print the data validation message
print(check_load(df, 5000, 74))
コードを編集して実行