โมเดล LDA
ถึงเวลาสร้างโมเดล LDA แล้ว โดยใช้ dictionary และ corpus ที่เตรียมไว้ เพื่อค้นหาว่ามีหัวข้อใดบ้างในอีเมลของ Enron จากนั้นพิมพ์คำที่ถูกจัดกลุ่มตามหัวข้อออกมาดู เพื่อสำรวจเบื้องต้นว่ามีหัวข้อที่โดดเด่นปรากฏขึ้นหรือไม่ โปรดทราบว่าโมเดล topic modeling นี้ต้องใช้การคำนวณค่อนข้างมาก จึงอาจใช้เวลาสักครู่ ลองรันดูกันเลย!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- สร้างโมเดล LDA จาก gensim models โดยใส่
corpusและdictionary - บันทึก 5 หัวข้อโดยรัน
printtopics บนผลลัพธ์ของโมเดล และเลือก 5 คำที่มีน้ำหนักสูงสุด
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)
# Save the topics and top 5 words
topics = ____.____(num_words=____)
# Print the results
for topic in topics:
print(topic)