การทำความสะอาดและนับคำ
ลบ stop words ออกเพื่อสำรวจเนื้อหาของทวีตในชุดข้อมูล twitter_data ที่ถูกจัดประเภทเป็นข้อร้องเรียนของสายการบิน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อความเบื้องต้นใน R
คำแนะนำการฝึกหัด
- แบ่งคำ (tokenize) ทวีตใน
twitter_dataโดยตั้งชื่อคอลัมน์ที่เก็บคำที่ผ่านการแบ่งแล้วว่าword - ลบ stop words เริ่มต้นออกจาก
twitter_dataที่ผ่านการแบ่งคำแล้ว - กรองเฉพาะทวีตที่เป็นข้อร้องเรียน
- คำนวณจำนวนครั้งของแต่ละคำโดยใช้ข้อความที่ผ่านการแบ่งและทำความสะอาดแล้ว จากนั้นเรียงลำดับจากมากไปน้อยตามจำนวน
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)