データ読み込みの検証
毎月新しいファイルを受け取るとしましょう。レコード数と列数は想定されています。この演習では、読み込んだファイルを検証する関数を作成します。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
- データ検証用の関数
check_load()を作成します。引数は、データフレームdf、レコード数num_records、列数num_columnsです。 num_recordsを使って、入力データフレームdfのcount()が同じ数かどうかをチェックします。- 入力データフレームの列数を、
columnsに対してlen()を使って測り、num_columnsと比較します。 - これらのチェックがどちらも
Trueであれば、Validation Passedと出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
def ____(____, ____, ____):
# Takes a dataframe and compares record and column counts to input
# Message to return if the critera below aren't met
message = 'Validation Failed'
# Check number of records
if num_records == df.____():
# Check number of columns
if num_columns == ____(df.____):
# Success message
message = ____
return message
# Print the data validation message
print(check_load(df, 5000, 74))