เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การดึงค่าที่ไม่ซ้ำกัน

บางครั้งการวิเคราะห์ข้อมูลไม่จำเป็นต้องใช้ทุก record แต่ต้องการเพียงค่าที่ไม่ซ้ำกันในคอลัมน์ใดคอลัมน์หนึ่งหรือมากกว่า ค่าที่ซ้ำกันสามารถลบออกได้หลังจากโหลดข้อมูลลงใน dataframe แล้ว หรือจะกรองตั้งแต่ขั้นตอนนำเข้าโดยใช้คีย์เวิร์ด DISTINCT ของ SQL ก็ได้

เนื่องจาก hpd311calls เก็บข้อมูลเกี่ยวกับปัญหาที่อยู่อาศัย เราคาดว่าเกือบทุก record จะมีการระบุ borough ไว้ ลองทดสอบสมมติฐานนี้โดยคิวรีหาค่าผสมที่ไม่ซ้ำกันของ complaint_type และ borough

pandas ถูก import ไว้แล้วในชื่อ pd และ database engine ถูกสร้างไว้แล้วในชื่อ engine

หมายเหตุ: ตัวตรวจสอบ SQL ค่อนข้างเข้มงวดเรื่องตำแหน่งคอลัมน์ โปรดเลือกฟิลด์ตามลำดับที่กำหนด

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การนำเข้าข้อมูลด้วย pandas อย่างมีประสิทธิภาพ

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างคิวรีที่ดึงค่า DISTINCT ของ borough และ complaint_type (ตามลำดับนี้) จาก hpd311calls
  • ใช้ read_sql() เพื่อโหลดผลลัพธ์ของคิวรีลงใน dataframe ชื่อ issues_and_boros
  • พิมพ์ dataframe เพื่อตรวจสอบว่าสมมติฐานที่ว่าทุกปัญหา (ยกเว้นคำขอด้านเอกสาร) มีการระบุ borough ไว้นั้นเป็นจริงหรือไม่

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
แก้ไขและรันโค้ด