สร้าง dictionary และ corpus
ก่อนจะรันโมเดล LDA topic model ได้ คุณต้องกำหนด dictionary และ corpus ก่อน เนื่องจากทั้งสองส่วนนี้จำเป็นต้องป้อนเข้าสู่โมเดล แบบฝึกหัดนี้จะต่อยอดจากข้อมูลข้อความที่ทำความสะอาดแล้วในแบบฝึกหัดก่อนหน้า โดย text_clean พร้อมให้ใช้งานแล้ว และคุณจะใช้มันเพื่อสร้าง dictionary และ corpus
แบบฝึกหัดนี้อาจใช้เวลาประมวลผลนานกว่าปกติเล็กน้อย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- Import แพ็กเกจ gensim และ corpora จาก gensim แยกกัน
- กำหนด dictionary โดยรันฟังก์ชันที่เหมาะสมบนข้อมูลที่ทำความสะอาดแล้ว
text_clean - กำหนด corpus โดยรัน
doc2bowบนข้อความแต่ละชิ้นในtext_clean - พิมพ์ผลลัพธ์เพื่อดูว่า
dictionaryและcorpusมีลักษณะอย่างไร
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)