เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Treemap สำหรับกลุ่มเอกสาร

บ่อยครั้งที่ต้องทำงานกับเอกสารที่จัดเป็นกลุ่ม เช่น กลุ่มตามผู้เขียน ผลิตภัณฑ์ หรือบริษัท แบบฝึกหัดนี้จะช่วยให้เข้าใจเนื้อหาของข้อความ พร้อมกับคงโครงสร้างกลุ่มไว้ในรูปแบบวิชวลที่กระชับ ตัวอย่างเช่น หากมีรีวิวของลูกค้าที่จัดกลุ่มตามผลิตภัณฑ์ อาจต้องการสำรวจรีวิวในหลายมิติพร้อมกัน เริ่มจากการคำนวณ polarity() ของรีวิว จากนั้นอาจพิจารณาความยาวของเอกสาร ซึ่งสามารถสะท้อนถึงความเข้มข้นทางอารมณ์ได้ เช่น ลูกค้าที่เขียนเพียง "รองเท้าดีมาก!" อาจแสดงถึงความกระตือรือร้นน้อยกว่าผู้ที่เขียนรีวิวเชิงบวกอย่างละเอียด นอกจากนี้ยังอาจต้องการจัดกลุ่มรีวิวตามประเภทผลิตภัณฑ์ เช่น รองเท้าผู้หญิง ผู้ชาย และเด็ก Treemap ช่วยให้สำรวจทุกมิติเหล่านี้ได้พร้อมกัน

สำหรับการวิเคราะห์ข้อความ แต่ละกล่องใน treemap แทนเอกสารหนึ่งชิ้น เช่น ทวีต เอกสารจะถูกจัดกลุ่มตามเกณฑ์ที่กำหนด เช่น ผู้เขียน ขนาดของแต่ละกล่องกำหนดจากค่าตัวเลข เช่น จำนวนคำหรือตัวอักษร ส่วนสีของกล่องกำหนดจากคะแนน sentiment

หลังจากจัดระเบียบ tibble แล้ว ให้ใช้ไลบรารี treemap ซึ่งมีฟังก์ชัน treemap() สำหรับสร้างวิชวล ตัวอย่างโค้ดด้านล่างแสดงการกำหนดข้อมูล ตัวแปรจัดกลุ่ม ขนาด สี และ aesthetics อื่น ๆ

treemap(
  data_frame,
  index = c("group", "individual_document"),
  vSize = "doc_length",
  vColor = "avg_score",
  type = "value",
  title = "Sentiment Scores by Doc",
  palette = c("red", "white", "green")
)

ออบเจกต์ all_books ที่โหลดไว้แล้วประกอบด้วย corpus ในรูปแบบ tidy ที่รวมหนังสือของ Shakespeare 4 เล่ม, Melville 3 เล่ม และ Twain 4 เล่ม จาก treemap ที่ได้ จะสามารถบอกได้ว่าใครเขียนหนังสือที่ยาวกว่า รวมถึง polarity ของนักเขียนแต่ละคนทั้งในภาพรวมและรายเล่ม

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ความรู้สึกใน R

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

book_length <- all_books %>%
  # Count number of words per book
  ___(___)
  
# Examine the results
book_length
แก้ไขและรันโค้ด