เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

โมเดล LDA

ถึงเวลาสร้างโมเดล LDA แล้ว โดยใช้ dictionary และ corpus ที่เตรียมไว้ เพื่อค้นหาว่ามีหัวข้อใดบ้างในอีเมลของ Enron จากนั้นพิมพ์คำที่ถูกจัดกลุ่มตามหัวข้อออกมาดู เพื่อสำรวจเบื้องต้นว่ามีหัวข้อที่โดดเด่นปรากฏขึ้นหรือไม่ โปรดทราบว่าโมเดล topic modeling นี้ต้องใช้การคำนวณค่อนข้างมาก จึงอาจใช้เวลาสักครู่ ลองรันดูกันเลย!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การตรวจจับการฉ้อโกงด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างโมเดล LDA จาก gensim models โดยใส่ corpus และ dictionary
  • บันทึก 5 หัวข้อโดยรัน print topics บนผลลัพธ์ของโมเดล และเลือก 5 คำที่มีน้ำหนักสูงสุด

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)

# Save the topics and top 5 words
topics = ____.____(num_words=____)

# Print the results
for topic in topics:
    print(topic)
แก้ไขและรันโค้ด