始める無料で始める

スキーマを定義する

スキーマを明示的に定義すると、データ品質の向上とインポートのパフォーマンス改善につながります。レッスンで説明したとおり、次の列を読み込むためのシンプルなスキーマを作成します。

  • Name
  • Age
  • City

NameCity 列は StringType()Age 列は IntegerType() です。

この演習はコースの一部です

PySpark でデータをクレンジングする

コースを見る

演習の手順

  • pyspark.sql.types ライブラリから * をインポートします。
  • StructType メソッドを使って新しいスキーマを定義します。
  • nameagecity 用に StructField を定義します。各フィールドは正しいデータ型に対応し、nullable ではないようにします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the pyspark.sql.types library
____

# Define a new schema using the StructType method
people_schema = ____([
  # Define a StructField for each field
  StructField('name', ____, False),
  ____('____', IntegerType(), ____)
  ____
])
コードを編集して実行