การใช้ Corr()
คำกล่าวที่ว่า 'Correlation does not imply Causation' เป็นเครื่องเตือนใจที่ดี อย่างไรก็ตาม ค่าสหสัมพันธ์ช่วยชี้ทิศทางให้รู้ว่าควรเริ่มต้นค้นหา feature ที่มีแนวโน้มเหมาะสมสำหรับโมเดลได้จากจุดใด ใช้แบบฝึกหัดนี้เพื่อฝึกค้นหาข้อมูลเป็นครั้งแรก และลองสังเกตหารูปแบบที่ซ่อนอยู่
รายการชื่อ columns ที่บรรจุชื่อคอลัมน์ต่าง ๆ ได้ถูกสร้างไว้ให้แล้ว ในแบบฝึกหัดนี้ให้คำนวณค่าสหสัมพันธ์ระหว่างคอลัมน์เหล่านั้นกับ 'SALESCLOSEPRICE' และค้นหาค่าสูงสุด
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering with PySpark
คำแนะนำการฝึกหัด
- ใช้ลูป
forวนซ้ำผ่านรายการcolumns - ในแต่ละรอบของลูป ให้คำนวณค่าสหสัมพันธ์ระหว่างคอลัมน์ปัจจุบันกับ
'SALESCLOSEPRICE'โดยใช้เมธอดcorr() - เขียนเงื่อนไขเพื่ออัปเดตค่าสหสัมพันธ์สูงสุดที่พบ พร้อมบันทึกว่าเป็นคอลัมน์ใด
- แสดงชื่อคอลัมน์ที่มีค่าสหสัมพันธ์สูงสุดกับ
'SALESCLOSEPRICE'
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)