การใช้คำนามในข่าวปลอม
ในแบบฝึกหัดนี้ มี dataframe ชื่อ headlines ที่เก็บพาดหัวข่าวซึ่งแบ่งเป็นข่าวปลอมและข่าวจริง งานของคุณคือสร้างฟีเจอร์ใหม่ 2 ตัว ได้แก่ num_propn และ num_noun เพื่อแทนจำนวนคำนามเฉพาะและคำนามทั่วไปที่ปรากฏในฟีเจอร์ title ของ headlines
จากนั้นจะคำนวณค่าเฉลี่ยจำนวนคำนามเฉพาะและคำนามทั่วไปในพาดหัวข่าวปลอมและข่าวจริง แล้วนำมาเปรียบเทียบกัน หากค่าแตกต่างกันอย่างมีนัยสำคัญ ก็มีโอกาสสูงที่การนำฟีเจอร์ num_propn และ num_noun ไปใช้ในระบบตรวจจับข่าวปลอมจะช่วยเพิ่มประสิทธิภาพได้
ฟังก์ชัน proper_nouns และ nouns ที่สร้างไว้ในแบบฝึกหัดก่อนหน้าได้ถูกเตรียมไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))