取得不重複的值
有時分析不需要每一筆紀錄,而是需要某些欄位中的不重複值。你可以在把資料載入 dataframe 後移除重複值,也可以在匯入時就用 SQL 的 DISTINCT 關鍵字處理。
因為 hpd311calls 包含住屋問題的資料,我們預期大多數紀錄都會有行政區(borough)。讓我們透過查詢唯一的 complaint_type/borough 組合來驗證這個假設。
pandas 已以 pd 匯入,且資料庫引擎已建立為 engine。
注意:SQL 檢查器對欄位順序相當嚴格,請依指定的順序選取欄位。
本練習屬於課程
使用 pandas 的精實資料導入
練習說明
- 撰寫一個查詢,從
hpd311calls依序取得borough與complaint_type的DISTINCT值(照此順序)。 - 使用
read_sql()將查詢結果載入為名為issues_and_boros的 dataframe。 - 印出該 dataframe,檢查除了文學需求(literature requests)以外的所有問題,是否都有對應的行政區。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)