การสร้าง DTM
สร้าง document term matrix (DTM) จากข้อมูล tidy_twitter ของเรา โดยถือว่าแต่ละทวีตคือเอกสารหนึ่งชิ้น ลองพิมพ์ tidy_twitter ใน console เพื่อตรวจสอบชื่อคอลัมน์
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อความเบื้องต้นใน R
คำแนะนำการฝึกหัด
- เริ่มต้นด้วยข้อมูล Twitter ที่จัดเรียบร้อยแล้ว
- นับจำนวนการใช้แต่ละคำในแต่ละทวีต
- นำจำนวนคำแยกตามทวีตมาสร้าง DTM
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Start with the tidied Twitter data
___ %>%
# Count each word used in each tweet
___(word, ___) %>%
# Use the word counts by tweet to create a DTM
cast_dtm(___, word, n)