開始使用免費開始

取得不重複的值

有時分析不需要每一筆紀錄,而是需要某些欄位中的不重複值。你可以在把資料載入 dataframe 後移除重複值,也可以在匯入時就用 SQL 的 DISTINCT 關鍵字處理。

因為 hpd311calls 包含住屋問題的資料,我們預期大多數紀錄都會有行政區(borough)。讓我們透過查詢唯一的 complaint_typeborough 組合來驗證這個假設。

pandas 已以 pd 匯入,且資料庫引擎已建立為 engine

注意:SQL 檢查器對欄位順序相當嚴格,請依指定的順序選取欄位。

本練習屬於課程

使用 pandas 的精實資料導入

檢視課程

練習說明

  • 撰寫一個查詢,從 hpd311calls 依序取得 boroughcomplaint_typeDISTINCT 值(照此順序)。
  • 使用 read_sql() 將查詢結果載入為名為 issues_and_boros 的 dataframe。
  • 印出該 dataframe,檢查除了文學需求(literature requests)以外的所有問題,是否都有對應的行政區。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
編輯並執行程式碼