データ型の検証
データの時代には、これまでになく多くの属性にアクセスできます。これらを扱うために多くの自動化を構築しますが、最低限、それぞれのデータ型が正しいことが前提です。この演習では、属性とそのデータ型のディクショナリが正しいかどうかを検証します。このディクショナリは validation_dict という変数に格納され、ワークスペースで利用できます。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
dfのdtypesを使って、属性名とデータ型のタプルからなるリストactual_dtypes_listを作成します。actual_dtypes_listを反復し、列名が期待するデータ型のディクショナリvalidation_dictに存在するかを確認します。- ディクショナリに存在するキーについてはデータ型を照合し、一致したものを出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')