始める無料で始める

データ型の検証

データの時代には、これまでになく多くの属性にアクセスできます。これらを扱うために多くの自動化を構築しますが、最低限、それぞれのデータ型が正しいことが前提です。この演習では、属性とそのデータ型のディクショナリが正しいかどうかを検証します。このディクショナリは validation_dict という変数に格納され、ワークスペースで利用できます。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • dfdtypes を使って、属性名とデータ型のタプルからなるリスト actual_dtypes_list を作成します。
  • actual_dtypes_list を反復し、列名が期待するデータ型のディクショナリ validation_dict に存在するかを確認します。
  • ディクショナリに存在するキーについてはデータ型を照合し、一致したものを出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)

# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
  
  # Check if column name is dictionary of expected dtypes
  col_name = attribute_tuple[____]
  if col_name in ____:

    # Compare attribute types
    col_type = attribute_tuple[____]
    if col_type == validation_dict[____]:
      print(col_name + ' has expected dtype.')
コードを編集して実行