การดึงค่าที่ไม่ซ้ำกัน
บางครั้งการวิเคราะห์ข้อมูลไม่จำเป็นต้องใช้ทุก record แต่ต้องการเพียงค่าที่ไม่ซ้ำกันในคอลัมน์ใดคอลัมน์หนึ่งหรือมากกว่า ค่าที่ซ้ำกันสามารถลบออกได้หลังจากโหลดข้อมูลลงใน dataframe แล้ว หรือจะกรองตั้งแต่ขั้นตอนนำเข้าโดยใช้คีย์เวิร์ด DISTINCT ของ SQL ก็ได้
เนื่องจาก hpd311calls เก็บข้อมูลเกี่ยวกับปัญหาที่อยู่อาศัย เราคาดว่าเกือบทุก record จะมีการระบุ borough ไว้ ลองทดสอบสมมติฐานนี้โดยคิวรีหาค่าผสมที่ไม่ซ้ำกันของ complaint_type และ borough
pandas ถูก import ไว้แล้วในชื่อ pd และ database engine ถูกสร้างไว้แล้วในชื่อ engine
หมายเหตุ: ตัวตรวจสอบ SQL ค่อนข้างเข้มงวดเรื่องตำแหน่งคอลัมน์ โปรดเลือกฟิลด์ตามลำดับที่กำหนด
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การนำเข้าข้อมูลด้วย pandas อย่างมีประสิทธิภาพ
คำแนะนำการฝึกหัด
- สร้างคิวรีที่ดึงค่า
DISTINCTของboroughและcomplaint_type(ตามลำดับนี้) จากhpd311calls - ใช้
read_sql()เพื่อโหลดผลลัพธ์ของคิวรีลงใน dataframe ชื่อissues_and_boros - พิมพ์ dataframe เพื่อตรวจสอบว่าสมมติฐานที่ว่าทุกปัญหา (ยกเว้นคำขอด้านเอกสาร) มีการระบุ borough ไว้นั้นเป็นจริงหรือไม่
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)