スキーマを定義する
スキーマを明示的に定義すると、データ品質の向上とインポートのパフォーマンス改善につながります。レッスンで説明したとおり、次の列を読み込むためのシンプルなスキーマを作成します。
- Name
- Age
- City
Name と City 列は StringType()、Age 列は IntegerType() です。
この演習はコースの一部です
PySpark でデータをクレンジングする
演習の手順
pyspark.sql.typesライブラリから*をインポートします。StructTypeメソッドを使って新しいスキーマを定義します。name、age、city用にStructFieldを定義します。各フィールドは正しいデータ型に対応し、nullableではないようにします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the pyspark.sql.types library
____
# Define a new schema using the StructType method
people_schema = ____([
# Define a StructField for each field
StructField('name', ____, False),
____('____', IntegerType(), ____)
____
])