PySpark MLlib には多くのモジュールとアルゴリズムがあり、それぞれ特定のタイプの問題を解くために設計されています。今回の課題に対して、正しいモジュールはどれでしょうか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
飛び込む前に、まずは問題設定を少し理解しましょう。そのうえで、データセットを統計的・視覚的に点検する方法を学びます。
実データが最初から分析に適した状態であることはほとんどありません。この章では、不要な情報の削除、欠損値の扱い、そして分析に追加のデータを取り込む方法を学びます。
この章では、Machine Learning モデルが学習に使える新しい特徴量を作成する方法を学びます。フィールドの組み合わせ、乱雑な列からの値の抽出、より良い結果のためのエンコーディングといったアプローチを取り上げます。
この章では、まずどの種類のモデルを選ぶかを学びます。次に、データをモデルに適用して評価する方法を学びます。最後に、結果の解釈方法とモデルを後で使えるように保存する方法を学びます。
現在の演習