wine データセットの Ash、Alcalinity of ash、Magnesium 列を使って線形モデルを学習させたいとします。ただし、これらの列はそれぞれ異なる尺度で測定されている可能性があり、線形モデルにバイアスがかかるおそれがあります。
wine
Ash
Alcalinity of ash
Magnesium
次のうち、これらの列に関する記述として正しいのはどれですか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、データの前処理とは具体的に何を指すのかを学びます。データ型の確認や欠損値への対処など、前処理の最初のステップに取り組みます。
この章ではデータの標準化に焦点を当てます。多くのモデルは、特徴量の分布やスケールについて前提を持っています。標準化は、データをその前提に合うよう整え、アルゴリズムの性能を高めるための方法です。
現在の演習
このセクションでは特徴量エンジニアリングについて学びます。既存の特徴量から、より有用な新しい特徴量を作成するさまざまな方法を扱います。数値とテキストの両方の特徴量から、エンコード、集約、情報抽出を行う方法を見ていきます。
この章では、データセットから最も重要な特徴量を選ぶためのいくつかの手法を扱います。冗長な特徴量の削除、テキストベクトルの扱い、主成分分析(PCA)を用いた特徴量数の削減について学びます。
ここまで学んだ前処理の知識を活かし、UFO の目撃情報を記録したデータセットで実際に手法を試していきます。