重複を除いた値を取得する
分析によっては、すべてのレコードではなく、1 列または複数列で重複のない値だけが必要なことがあります。重複はデータをデータフレームに読み込んだ後に削除できますが、SQL の DISTINCT キーワードを使えばインポート時に除外することもできます。
hpd311calls には住宅問題に関するデータが含まれているので、ほとんどのレコードで区(borough)が記載されているはずです。この仮定を、complaint_type と borough の一意な組み合わせをクエリして確かめましょう。
pandas は pd としてインポート済みで、データベースエンジンは engine として作成されています。
Note: SQL チェッカーは列の位置に非常に厳密で、指定した順序でフィールドが選択されることを期待します。
この演習はコースの一部です
pandasで効率よくデータを取り込む
演習の手順
hpd311callsからboroughとcomplaint_type(この順序)のDISTINCT値を取得するクエリを作成します。read_sql()を使って、クエリ結果をデータフレームissues_and_borosに読み込みます。- 文学に関するリクエスト以外のすべての問題が区(borough)と一緒に掲載されているという仮定を確かめるため、データフレームを表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)