or
この演習はコースの一部です
生データは、必ずしも分析に最適な形で与えられるとは限りません。この第1章では、モデルの性能と解釈性を高めるために、特徴量をどのように変換・作成するかを最初に見ていきます。
この章では、手作業での変換にとどまらず、tidyverse のツールを活用してプログラム的に新しい変数を作成できることを学びます。こうしたアプローチがモデルの再現性を高め、特に多くの特徴量を含むデータセットを扱う際に有用であることを確認します。
この章では、高次元データから次元を削減し、特徴量を抽出することがモデルに有益である場面を学びます。具体的には、テキストデータを数値に変換する方法、カテゴリデータのエンコーディング、変数の予測力の順位付けなどを扱います。主成分分析、カーネル主成分分析、テキストからの数値抽出、カテゴリカル・エンコーディング、変数重要度スコアといった手法を探究します。
現在の演習
このコースの締めくくりとして、特徴量エンジニアリングと Machine Learning の手法を学びます。まず、利用可能なすべての特徴量をモデルに使うことによる問題点に着目し、無関係・冗長な特徴量を見極めて除去する重要性、そして lasso や elastic-net のような埋め込み法でそれを行う方法を学びます。次に、lasso、ridge、elastic-net などの縮小法を取り上げ、係数の正則化や、係数をゼロにして特徴量選択を行う手法を学びます。最後に、エンドツーエンドの特徴量エンジニアリングのワークフローを構築し、これまで学んだ概念や関数を小さなプロジェクトで復習・実践して締めくくります。