เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สร้าง Corpora ตามค่า Polarity

ในแบบฝึกหัดนี้ คุณจะทำขั้นตอนที่ 3 ของกระบวนการ Text Mining แม้ว่า qdap จะไม่ใช่แพ็กเกจแบบ tidy แต่จะใช้ mutate() เพื่อสร้างคอลัมน์ใหม่จากลิสต์ polarity ที่ส่งคืนมา ซึ่งแทน polarity ทั้งหมด (นั่นคือคำใบ้) ในบทที่ 3 เราใช้ฟังก์ชันที่กำหนดเองชื่อ pol_subsections ซึ่งใช้เฉพาะ base R แต่ในแบบฝึกหัดนี้จะยึดหลัก tidy โดยใช้ filter() แล้วแนะนำ pull() ฟังก์ชัน pull() ทำงานคล้ายกับ [[ เพื่อดึงตัวแปรเดี่ยวออกมา

เมื่อแยกข้อมูลได้แล้ว ให้รวมคอมเมนต์เชิงบวกและเชิงลบทั้งหมดเข้าเป็นเอกสารขนาดใหญ่สองชิ้น ที่แทนคำทั้งหมดในรีวิวการเช่าเชิงบวกและเชิงลบ

สุดท้าย จะสร้าง Term Document Matrix (TDM) แบบถ่วงน้ำหนักด้วย Term Frequency Inverse Document Frequency (TFIDF) เนื่องจากโค้ดในแบบฝึกหัดนี้เริ่มต้นจากโครงสร้าง tidy จึงใช้ฟังก์ชันบางส่วนจาก tm ร่วมกับ %>% เพื่อให้รูปแบบสอดคล้องกัน หากยังไม่คุ้นเคยกับพื้นฐานของแพ็กเกจ tm ลองดูคอร์ส Text Mining with Bag-of-Words in R แทนที่จะนับจำนวนครั้งที่ใช้คำ (ความถี่) ค่าใน TDM จะถูกหักคะแนนสำหรับคำที่ถูกใช้บ่อยเกินไป ซึ่งช่วยลดคำที่ไม่มีข้อมูลที่เป็นประโยชน์

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ความรู้สึกใน R

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
แก้ไขและรันโค้ด