อาร์เรย์ความถี่คำแบบ tf-idf
ในแบบฝึกหัดนี้ จะสร้างอาร์เรย์ความถี่คำแบบ tf-idf สำหรับชุดเอกสารตัวอย่างขนาดเล็ก โดยใช้ TfidfVectorizer จาก sklearn ซึ่งจะแปลงรายการเอกสารให้กลายเป็นอาร์เรย์ความถี่คำ และส่งออกผลลัพธ์เป็น csr_matrix มีทั้งเมธอด fit() และ transform() เช่นเดียวกับออบเจ็กต์อื่น ๆ ใน sklearn
มีรายการ documents ซึ่งเป็นเอกสารตัวอย่างเกี่ยวกับสัตว์เลี้ยงเตรียมไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Unsupervised Learning ใน Python
คำแนะนำการฝึกหัด
- Import
TfidfVectorizerจากsklearn.feature_extraction.text - สร้าง instance ของ
TfidfVectorizerชื่อtfidf - เรียกใช้เมธอด
.fit_transform()ของtfidfกับdocumentsแล้วกำหนดผลลัพธ์ให้กับcsr_matซึ่งเป็นอาร์เรย์ความถี่คำในรูปแบบ csr_matrix - ตรวจสอบ
csr_matโดยเรียกเมธอด.toarray()แล้วพิมพ์ผลลัพธ์ ส่วนนี้เตรียมไว้ให้แล้ว - คอลัมน์ของอาร์เรย์สอดคล้องกับคำแต่ละคำ ดึงรายการคำโดยเรียกเมธอด
.get_feature_names_out()ของtfidfแล้วกำหนดผลลัพธ์ให้กับwords
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)