or
この演習はコースの一部です
この章では、特徴量エンジニアリングとは何か、そして実データにどう適用し始めればよいかを学びます。アンケート回答データセットを読み込み、探索・可視化しながら、その背後にあるデータ型と、それが特徴量設計の方法にどのような影響を与えるかを理解します。pandas パッケージを使って、カテゴリカル列と連続値列の両方から新しい特徴量を作成します。
この章では、乱れて不完全なデータという現実を紹介します。欠損値がどこにあるかを見つける方法を学び、それらへ対処する複数のアプローチを探ります。さらに、データセット内の不要な文字に対処するために、文字列操作のテクニックも活用します。
この章では、データの背後にある分布を分析し、それが Machine Learning パイプラインに影響するかどうかに焦点を当てます。歪んだ分布への対処方法や、外れ値が分析に悪影響を与える状況への対応方法を学びます。
最後の章では、非構造化テキストデータを扱い、テキストコーパスから列状の特徴量を設計する方法を学びます。アプローチの違いが、テキストから抽出できる文脈量にどう影響するかを比較し、特徴量が増えすぎないように文脈の確保とバランスを取る方法を考えます。
現在の演習