組み合わせ技!
ここまでで、よく使われる4種類のデータ操作である、行の並べ替え、列のサブセット化、行のサブセット化、新しい列の追加を見てきました。実際のデータ分析では、これら4つの操作を組み合わせることで、さまざまな問いに答えられます。
この演習では、「州人口1万人当たりのホームレスの人数が最も多い週はどこか?」という問いに答えます。新しく身につけた pandas のスキルを活用しましょう。
この演習はコースの一部です
pandas によるデータ操作
演習の手順
homelessnessに、state_popを州人口として使った、各州の人口1万人当たりのホームレスの人数を含むindiv_per_10k列を追加しましょう。indiv_per_10kが20より大きい行をサブセット化し、high_homelessnessに代入しましょう。high_homelessnessをindiv_per_10kの降順で並べ替え、high_homelessness_srtに代入しましょう。high_homelessness_srtのstate列とindiv_per_10k列だけを選択し、resultとして保存しましょう。resultを確認しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create indiv_per_10k col as homeless individuals per 10k state pop
homelessness["indiv_per_10k"] = 10000 * ____ / ____
# Subset rows for indiv_per_10k greater than 20
high_homelessness = ____
# Sort high_homelessness by descending indiv_per_10k
high_homelessness_srt = ____
# From high_homelessness_srt, select the state and indiv_per_10k cols
result = ____
# See the result
print(result)