เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การทำความสะอาดและนับคำ

ลบ stop words ออกเพื่อสำรวจเนื้อหาของทวีตในชุดข้อมูล twitter_data ที่ถูกจัดประเภทเป็นข้อร้องเรียนของสายการบิน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ข้อความเบื้องต้นใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แบ่งคำ (tokenize) ทวีตใน twitter_data โดยตั้งชื่อคอลัมน์ที่เก็บคำที่ผ่านการแบ่งแล้วว่า word
  • ลบ stop words เริ่มต้นออกจาก twitter_data ที่ผ่านการแบ่งคำแล้ว
  • กรองเฉพาะทวีตที่เป็นข้อร้องเรียน
  • คำนวณจำนวนครั้งของแต่ละคำโดยใช้ข้อความที่ผ่านการแบ่งและทำความสะอาดแล้ว จากนั้นเรียงลำดับจากมากไปน้อยตามจำนวน

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
แก้ไขและรันโค้ด