始める無料で始める

カテゴリカル列

フライトデータには carrierorg という2つの列があり、どちらもカテゴリカルデータを保持しています。これらの列を数値インデックスに変換する必要があります。

この演習はコースの一部です

Machine Learning with PySpark

コースを見る

演習の手順

  • 適切なクラスをインポートし、carrier 列を文字列から数値インデックスに変換するためのインデクサオブジェクトを作成します。
  • フライトデータを使ってインデクサオブジェクトを準備します。
  • 準備したインデクサを使って、数値インデックス列を作成します。
  • org 列についても同じ手順を繰り返します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from pyspark.ml.feature import ____

# Create an indexer
indexer = ____(inputCol=____, outputCol='carrier_idx')

# Indexer identifies categories in the data
indexer_model = indexer.____(flights)

# Indexer creates a new column with numeric index values
flights_indexed = ____.____(____)

# Repeat the process for the other categorical feature
flights_indexed = ____(inputCol=____, outputCol='org_idx').____(____).____(____)
flights_indexed.show(5)
コードを編集して実行