アナリストは、カテゴリカル列に基づく可視化を求められることがよくあります。目的に合った最適な可視化を選ぶには練習が必要です。この演習では、本章で扱った4種類のプロットをおさらいし、可視化を作るときに正しいプロットを選べるようにします。
この演習では、異なる kind のプロットを、指示に示された順番になるようにドラッグして並べ替えてください。
kind
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
ほぼすべてのデータセットにはカテゴリ情報が含まれており、見過ごされがちな“情報の宝庫”です。この章では、pandas が category というデータ型でカテゴリ列をどのように扱うかを学びます。さらに、データをカテゴリでグループ化して、有益な要約統計量を導き出す方法も身につけます。
ここでは、Series に対してカテゴリの設定・追加・削除を行う方法を学びます。さらに、カテゴリの更新、名称変更、統合(折りたたみ)、並べ替えを行い、そのスキルを使って DataFrame 内の他のデータを整形・参照する方法も探ります。
この章では、Python ライブラリの seaborn を使って、カテゴリカルデータによる有益な可視化を作成します。具体的には、カテゴリプロット(cat-plot)、箱ひげ図、棒グラフ、ポイントプロット、カウントプロットを扱います。続いて、カテゴリ列を可視化し、カテゴリでデータを分割して、数値列の要約統計量を視覚化する方法を学びます。
現在の演習
最後に、カテゴリカルデータを扱う際の一般的な落とし穴を回避する方法を学びます。さらに、Machine Learning 向けの前処理に役立つ label encoding と one-hot encoding を紹介し、データのエンコーディングスキルを強化します。