ทบทวน TM (I)
ในคอร์ส Text Mining: Bag of Words คุณได้เรียนรู้ว่า corpus คือชุดของข้อความ และได้ศึกษาฟังก์ชันต่าง ๆ สำหรับการเตรียมข้อความ เพื่อทบทวนความเข้าใจ วิธีหนึ่งในการสร้างและทำความสะอาด corpus คือการใช้ฟังก์ชันต่อไปนี้ แม้ว่านี่จะเป็นคอร์สที่แตกต่างออกไป แต่การวิเคราะห์ความรู้สึกเป็นส่วนหนึ่งของ text mining ดังนั้นการทบทวนจึงมีประโยชน์
- แปลง character vector ให้เป็น text source โดยใช้
VectorSource() - แปลง text source ให้เป็น corpus โดยใช้
VCorpus() - ลบอักขระที่ไม่ต้องการออกจาก corpus โดยใช้ฟังก์ชันทำความสะอาด เช่น
removePunctuation()และstripWhitespace()จากtmรวมถึงreplace_abbreviation()จากqdap
ในแบบฝึกหัดนี้ได้สร้างฟังก์ชัน clean_corpus() แบบกำหนดเองโดยใช้ฟังก์ชันการเตรียมข้อความมาตรฐาน เพื่อให้ใช้งานได้สะดวกยิ่งขึ้น
clean_corpus() รับผลลัพธ์จาก VCorpus() และนำฟังก์ชันทำความสะอาดมาใช้ ตัวอย่างเช่น:
processed_corpus <- clean_corpus(my_corpus)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ความรู้สึกใน R
คำแนะนำการฝึกหัด
ใน R session มี text vector ชื่อ tm_define ที่ประกอบด้วยเอกสารขนาดเล็ก 2 รายการ และฟังก์ชัน clean_corpus()
- สร้างอ็อบเจกต์ชื่อ
tm_vectorโดยใช้VectorSource()กับtm_define - สร้าง
tm_corpusโดยใช้VCorpus()กับtm_vector - ใช้
content()เพื่อตรวจสอบเนื้อหาของเอกสารแรกในtm_corpus- การเข้าถึงเอกสารใน corpus ใช้ไวยากรณ์แบบ list ดังนั้นให้ใช้วงเล็บเหลี่ยมคู่ เช่น
[[1]]
- การเข้าถึงเอกสารใน corpus ใช้ไวยากรณ์แบบ list ดังนั้นให้ใช้วงเล็บเหลี่ยมคู่ เช่น
- ทำความสะอาดข้อความใน corpus โดยใช้ฟังก์ชัน
clean_corpus()กับtm_corpusแล้วตั้งชื่ออ็อบเจกต์ใหม่นี้ว่าtm_clean - ตรวจสอบเอกสารแรกของอ็อบเจกต์
tm_cleanอีกครั้ง เพื่อดูว่าข้อความเปลี่ยนแปลงไปอย่างไรหลังจากใช้clean_corpus()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___