เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การจัดการกับอักขระแปลกปลอม (II)

ในแบบฝึกหัดที่ผ่านมา คุณสามารถระบุได้อย่างรวดเร็วจากการเรียก df.head() ว่าอักขระใดกำลังก่อปัญหา แต่ในหลายกรณี สิ่งนี้อาจไม่ชัดเจนเลย บางครั้งค่าที่มีปัญหาอาจซ่อนอยู่ลึกภายในคอลัมน์ และขัดขวางไม่ให้แปลงคอลัมน์เป็นชนิดข้อมูลตัวเลขเพื่อนำไปใช้กับโมเดลหรือการสร้าง feature ต่อไปได้

วิธีหนึ่งในการค้นหาค่าเหล่านี้คือการบังคับแปลงคอลัมน์เป็นชนิดข้อมูลที่ต้องการโดยใช้ pd.to_numeric() พร้อมกับแปลงค่าที่มีปัญหาให้เป็น NaN จากนั้นกรอง DataFrame เพื่อดูเฉพาะแถวที่มีค่า NaN

ลองแปลงคอลัมน์ RawSalary เป็น float ดู ซึ่งจะพบว่าล้มเหลวเนื่องจากมีอักขระพิเศษอีกตัวหนึ่งแอบซ่อนอยู่ในคอลัมน์นั้น ให้ค้นหาอักขระดังกล่าวและลบออก เพื่อให้สามารถแปลงคอลัมน์เป็น float ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
แก้ไขและรันโค้ด