การระบุคำที่มีความหมายบวกและลบมากที่สุด
ในแบบฝึกหัดนี้ เราจะลองตีความสัมประสิทธิ์ของโมเดล logistic regression ที่ฝึกบนชุดข้อมูลความรู้สึกจากรีวิวภาพยนตร์ โดยโมเดลถูกสร้างและฝึกไว้ให้แล้วในตัวแปร lr
นอกจากนี้ คำที่สอดคล้องกับ feature แต่ละตัวถูกโหลดไว้ในตัวแปร vocab ตัวอย่างเช่น vocab[100] คือ "think" หมายความว่า feature ที่ 100 แทนจำนวนครั้งที่คำว่า "think" ปรากฏในรีวิวภาพยนตร์นั้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Linear Classifiers ใน Python
คำแนะนำการฝึกหัด
- หาคำที่สอดคล้องกับสัมประสิทธิ์ที่มีค่ามากที่สุด 5 อันดับแรก
- หาคำที่สอดคล้องกับสัมประสิทธิ์ที่มีค่าน้อยที่สุด 5 อันดับแรก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Get the indices of the sorted cofficients
inds_ascending = np.argsort(lr.coef_.flatten())
inds_descending = inds_ascending[::-1]
# Print the most positive words
print("Most positive words: ", end="")
for i in range(5):
print(____, end=", ")
print("\n")
# Print most negative words
print("Most negative words: ", end="")
for i in range(5):
print(____, end=", ")
print("\n")