เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้ Corr()

คำกล่าวที่ว่า 'Correlation does not imply Causation' เป็นเครื่องเตือนใจที่ดี อย่างไรก็ตาม ค่าสหสัมพันธ์ช่วยชี้ทิศทางให้รู้ว่าควรเริ่มต้นค้นหา feature ที่มีแนวโน้มเหมาะสมสำหรับโมเดลได้จากจุดใด ใช้แบบฝึกหัดนี้เพื่อฝึกค้นหาข้อมูลเป็นครั้งแรก และลองสังเกตหารูปแบบที่ซ่อนอยู่

รายการชื่อ columns ที่บรรจุชื่อคอลัมน์ต่าง ๆ ได้ถูกสร้างไว้ให้แล้ว ในแบบฝึกหัดนี้ให้คำนวณค่าสหสัมพันธ์ระหว่างคอลัมน์เหล่านั้นกับ 'SALESCLOSEPRICE' และค้นหาค่าสูงสุด

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ลูป for วนซ้ำผ่านรายการ columns
  • ในแต่ละรอบของลูป ให้คำนวณค่าสหสัมพันธ์ระหว่างคอลัมน์ปัจจุบันกับ 'SALESCLOSEPRICE' โดยใช้เมธอด corr()
  • เขียนเงื่อนไขเพื่ออัปเดตค่าสหสัมพันธ์สูงสุดที่พบ พร้อมบันทึกว่าเป็นคอลัมน์ใด
  • แสดงชื่อคอลัมน์ที่มีค่าสหสัมพันธ์สูงสุดกับ 'SALESCLOSEPRICE'

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
แก้ไขและรันโค้ด