เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การนับจำนวนตัวอักษรในทวีตภาษารัสเซีย

ในแบบฝึกหัดนี้ คุณจะได้รับ dataframe ชื่อ tweets ซึ่งรวบรวมทวีตที่เกี่ยวข้องกับ Internet Research Agency ของรัสเซีย โดย FiveThirtyEight

โจทย์คือให้สร้างฟีเจอร์ใหม่ชื่อ 'char_count' ใน tweets เพื่อนับจำนวนตัวอักษรของแต่ละทวีต และคำนวณความยาวเฉลี่ยของทวีตทั้งหมด โดยข้อมูลทวีตอยู่ในฟีเจอร์ content ของ tweets

โปรดทราบว่านี่คือข้อมูลจริงจาก Twitter ซึ่งอาจมีคำหยาบหรือเนื้อหาที่ไม่เหมาะสมปรากฏอยู่ (ทั้งในแบบฝึกหัดนี้และแบบฝึกหัดอื่นที่ใช้ข้อมูล Twitter จริง)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างฟีเจอร์ใหม่ char_count โดยใช้ len กับฟีเจอร์ 'content' ของ tweets
  • แสดงค่าเฉลี่ยจำนวนตัวอักษรของทวีต โดยคำนวณค่าเฉลี่ยจากฟีเจอร์ 'char_count'

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)

# Print the average character count
print(tweets[____].____)
แก้ไขและรันโค้ด