カテゴリカル列
フライトデータには carrier と org という2つの列があり、どちらもカテゴリカルデータを保持しています。これらの列を数値インデックスに変換する必要があります。
この演習はコースの一部です
Machine Learning with PySpark
演習の手順
- 適切なクラスをインポートし、
carrier列を文字列から数値インデックスに変換するためのインデクサオブジェクトを作成します。 - フライトデータを使ってインデクサオブジェクトを準備します。
- 準備したインデクサを使って、数値インデックス列を作成します。
org列についても同じ手順を繰り返します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from pyspark.ml.feature import ____
# Create an indexer
indexer = ____(inputCol=____, outputCol='carrier_idx')
# Indexer identifies categories in the data
indexer_model = indexer.____(flights)
# Indexer creates a new column with numeric index values
flights_indexed = ____.____(____)
# Repeat the process for the other categorical feature
flights_indexed = ____(inputCol=____, outputCol='org_idx').____(____).____(____)
flights_indexed.show(5)