การสรุปข้อมูลแบบกลุ่ม
จะเห็นว่าใน twitter_data มีทวีตที่ไม่ใช่การร้องเรียนมากกว่าทวีตที่เป็นการร้องเรียน คุณอาจเริ่มสงสัยว่าข้อมูลนี้มาจาก Twitter จริงหรือเปล่า! ยังมีคอลัมน์อื่นใน twitter_data ที่น่าสนใจและควรสำรวจก่อนจะเข้าถึงตัวทวีต ทุกทวีตจะบันทึกจำนวนผู้ติดตามของผู้ใช้ไว้ในคอลัมน์ usr_followers_count คิดว่าผู้ที่ร้องเรียนจะมีผู้ติดตามมากกว่าหรือน้อยกว่าผู้ที่ไม่ร้องเรียนโดยเฉลี่ย? ใช้การสรุปข้อมูลแบบกลุ่มเพื่อหาคำตอบได้อย่างรวดเร็ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อความเบื้องต้นใน R
คำแนะนำการฝึกหัด
- จัดกลุ่มข้อมูลตาม
complaint_label - คำนวณค่าเฉลี่ย ค่าต่ำสุด และค่าสูงสุดของ
usr_followers_count
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Start with the data frame
___ %>%
# Group the data by whether or not the tweet is a complaint
___(___) %>%
# Compute the mean, min, and max follower counts
summarize(
avg_followers = ___(___),
min_followers = ___(___),
max_followers = ___(___)
)