เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

กำหนดค่า NA แบบกำหนดเอง

ส่วนหนึ่งของการสำรวจและทำความสะอาดข้อมูลคือการตรวจสอบค่าที่ขาดหายไปหรือค่า NA และตัดสินใจว่าจะจัดการกับค่าเหล่านั้นอย่างไร ขั้นตอนนี้จะทำได้ง่ายขึ้นเมื่อค่าที่ขาดหายถูกกำหนดเป็นชนิดข้อมูลของตัวเอง ซึ่ง pandas มีฟังก์ชันที่ใช้จัดการกับค่า NA โดยเฉพาะ pandas จะถือว่าบางค่าเป็นค่าที่ขาดหายโดยอัตโนมัติ แต่เราสามารถระบุตัวบ่งชี้ NA เพิ่มเติมได้ผ่านอาร์กิวเมนต์ na_values ในแบบฝึกหัดนี้ เราจะใช้วิธีนี้เพื่อให้แน่ใจว่ารหัส ZIP ที่ไม่ถูกต้องในข้อมูลภาษีของรัฐเวอร์มอนต์ถูกเข้ารหัสเป็น NA

นำเข้า pandas แล้วในชื่อ pd

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การนำเข้าข้อมูลด้วย pandas อย่างมีประสิทธิภาพ

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง dictionary ชื่อ null_values โดยระบุว่าค่า 0 ในคอลัมน์ zipcode ควรถูกมองว่าเป็นค่า NA
  • โหลด vt_tax_data_2016.csv โดยใช้อาร์กิวเมนต์ na_values ร่วมกับ dictionary ที่สร้างขึ้น เพื่อให้รหัส ZIP ที่ไม่ถูกต้องถูกถือว่าเป็นค่าที่ขาดหาย

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create dict specifying that 0s in zipcode are NA values
null_values = {____}

# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv", 
                   ____)

# View rows with NA ZIP codes
print(data[data.zipcode.isna()])
แก้ไขและรันโค้ด