TfIdf ครั้งแรกของคุณ
ในแบบฝึกหัดนี้ จะได้ลองใช้วิธี TfIdf กับชุดข้อมูลขนาดเล็กชื่อ annak ซึ่งประกอบด้วยประโยคแรกของนวนิยายเรื่อง Anna Karenina โดย Leo Tolstoy
โจทย์คือการทำงานกับชุดข้อมูลนี้และนำฟังก์ชัน TfidfVectorizer() มาใช้ ทบทวนไว้ว่าการแปลงข้อความให้เป็นตัวเลขคือก้าวแรกในการวิเคราะห์ความรู้สึกของข้อความ และ TfIdf vectorizer ก็เป็นอีกวิธีหนึ่งในการสร้าง vocabulary จากคอลัมน์ sentiment ของเรา
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- นำเข้าฟังก์ชันสำหรับสร้าง TfIdf vectorizer จาก
sklearn.feature_extraction.text - เรียกใช้ฟังก์ชัน
TfidfVectorizer()แล้ว fit กับชุดข้อมูลannak - แปลงข้อมูลด้วย vectorizer
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Call the vectorizer and fit it
anna_vect = ____.___(annak)
# Create the tfidf representation
anna_tfidf = anna_vect.____(annak)
# Print the result
print(anna_tfidf.toarray())