การนับจำนวนตัวอักษรในทวีตภาษารัสเซีย
ในแบบฝึกหัดนี้ คุณจะได้รับ dataframe ชื่อ tweets ซึ่งรวบรวมทวีตที่เกี่ยวข้องกับ Internet Research Agency ของรัสเซีย โดย FiveThirtyEight
โจทย์คือให้สร้างฟีเจอร์ใหม่ชื่อ 'char_count' ใน tweets เพื่อนับจำนวนตัวอักษรของแต่ละทวีต และคำนวณความยาวเฉลี่ยของทวีตทั้งหมด โดยข้อมูลทวีตอยู่ในฟีเจอร์ content ของ tweets
โปรดทราบว่านี่คือข้อมูลจริงจาก Twitter ซึ่งอาจมีคำหยาบหรือเนื้อหาที่ไม่เหมาะสมปรากฏอยู่ (ทั้งในแบบฝึกหัดนี้และแบบฝึกหัดอื่นที่ใช้ข้อมูล Twitter จริง)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- สร้างฟีเจอร์ใหม่
char_countโดยใช้lenกับฟีเจอร์ 'content' ของtweets - แสดงค่าเฉลี่ยจำนวนตัวอักษรของทวีต โดยคำนวณค่าเฉลี่ยจากฟีเจอร์ 'char_count'
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)