เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแปลผลลัพธ์

การรู้ว่าฟีเจอร์ใดส่งผลต่อการพยากรณ์มากที่สุดนั้นสำคัญเสมอ บางทีผลลัพธ์อาจดูขัดกับสัญชาตญาณ ซึ่งนั่นก็เป็น insight ที่มีคุณค่า หรืออาจพบว่าฟีเจอร์เพียงไม่กี่ตัวคิดเป็นส่วนใหญ่ของความแม่นยำของโมเดล ทำให้ไม่จำเป็นต้องเสียเวลาเก็บหรือปรับแต่งฟีเจอร์อื่น ๆ

ในตัวอย่างนี้ เราจะดูโมเดลที่ถูกเทรนมาโดยไม่มีข้อมูล LISTPRICE เลย เมื่อไม่มีข้อมูลนั้น อะไรที่ส่งผลต่อราคามากที่สุด?

  • หมายเหตุ: อาร์เรย์ค่าความสำคัญของฟีเจอร์ importances ได้ถูกสร้างไว้ให้แล้วจาก model.featureImportances.toArray()

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง pandas dataframe โดยใช้ค่าจาก importances และตั้งชื่อคอลัมน์ว่า importance ด้วยการกำหนดพารามิเตอร์ columns
  • ใช้รายการชื่อฟีเจอร์ feature_cols ที่นำเข้ามาแล้ว สร้าง pandas.Series ใหม่โดยครอบด้วยฟังก์ชัน pd.Series() แล้วกำหนดให้กับคอลัมน์ fi_df['feature']
  • จัดเรียง dataframe ด้วย sort_values() โดยตั้งค่าพารามิเตอร์ by เป็นคอลัมน์ importance และเรียงจากมากไปน้อยโดยตั้งค่า ascending เป็น False จากนั้นตรวจสอบผลลัพธ์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
แก้ไขและรันโค้ด