เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ทบทวน TM (I)

ในคอร์ส Text Mining: Bag of Words คุณได้เรียนรู้ว่า corpus คือชุดของข้อความ และได้ศึกษาฟังก์ชันต่าง ๆ สำหรับการเตรียมข้อความ เพื่อทบทวนความเข้าใจ วิธีหนึ่งในการสร้างและทำความสะอาด corpus คือการใช้ฟังก์ชันต่อไปนี้ แม้ว่านี่จะเป็นคอร์สที่แตกต่างออกไป แต่การวิเคราะห์ความรู้สึกเป็นส่วนหนึ่งของ text mining ดังนั้นการทบทวนจึงมีประโยชน์

  • แปลง character vector ให้เป็น text source โดยใช้ VectorSource()
  • แปลง text source ให้เป็น corpus โดยใช้ VCorpus()
  • ลบอักขระที่ไม่ต้องการออกจาก corpus โดยใช้ฟังก์ชันทำความสะอาด เช่น removePunctuation() และ stripWhitespace() จาก tm รวมถึง replace_abbreviation() จาก qdap

ในแบบฝึกหัดนี้ได้สร้างฟังก์ชัน clean_corpus() แบบกำหนดเองโดยใช้ฟังก์ชันการเตรียมข้อความมาตรฐาน เพื่อให้ใช้งานได้สะดวกยิ่งขึ้น

clean_corpus() รับผลลัพธ์จาก VCorpus() และนำฟังก์ชันทำความสะอาดมาใช้ ตัวอย่างเช่น:

processed_corpus <- clean_corpus(my_corpus)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ความรู้สึกใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

ใน R session มี text vector ชื่อ tm_define ที่ประกอบด้วยเอกสารขนาดเล็ก 2 รายการ และฟังก์ชัน clean_corpus()

  • สร้างอ็อบเจกต์ชื่อ tm_vector โดยใช้ VectorSource() กับ tm_define
  • สร้าง tm_corpus โดยใช้ VCorpus() กับ tm_vector
  • ใช้ content() เพื่อตรวจสอบเนื้อหาของเอกสารแรกใน tm_corpus
    • การเข้าถึงเอกสารใน corpus ใช้ไวยากรณ์แบบ list ดังนั้นให้ใช้วงเล็บเหลี่ยมคู่ เช่น [[1]]
  • ทำความสะอาดข้อความใน corpus โดยใช้ฟังก์ชัน clean_corpus() กับ tm_corpus แล้วตั้งชื่ออ็อบเจกต์ใหม่นี้ว่า tm_clean
  • ตรวจสอบเอกสารแรกของอ็อบเจกต์ tm_clean อีกครั้ง เพื่อดูว่าข้อความเปลี่ยนแปลงไปอย่างไรหลังจากใช้ clean_corpus()

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
แก้ไขและรันโค้ด