เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

อาร์เรย์ความถี่คำแบบ tf-idf

ในแบบฝึกหัดนี้ จะสร้างอาร์เรย์ความถี่คำแบบ tf-idf สำหรับชุดเอกสารตัวอย่างขนาดเล็ก โดยใช้ TfidfVectorizer จาก sklearn ซึ่งจะแปลงรายการเอกสารให้กลายเป็นอาร์เรย์ความถี่คำ และส่งออกผลลัพธ์เป็น csr_matrix มีทั้งเมธอด fit() และ transform() เช่นเดียวกับออบเจ็กต์อื่น ๆ ใน sklearn

มีรายการ documents ซึ่งเป็นเอกสารตัวอย่างเกี่ยวกับสัตว์เลี้ยงเตรียมไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Unsupervised Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import TfidfVectorizer จาก sklearn.feature_extraction.text
  • สร้าง instance ของ TfidfVectorizer ชื่อ tfidf
  • เรียกใช้เมธอด .fit_transform() ของ tfidf กับ documents แล้วกำหนดผลลัพธ์ให้กับ csr_mat ซึ่งเป็นอาร์เรย์ความถี่คำในรูปแบบ csr_matrix
  • ตรวจสอบ csr_mat โดยเรียกเมธอด .toarray() แล้วพิมพ์ผลลัพธ์ ส่วนนี้เตรียมไว้ให้แล้ว
  • คอลัมน์ของอาร์เรย์สอดคล้องกับคำแต่ละคำ ดึงรายการคำโดยเรียกเมธอด .get_feature_names_out() ของ tfidf แล้วกำหนดผลลัพธ์ให้กับ words

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import TfidfVectorizer
from ____ import ____

# Create a TfidfVectorizer: tfidf
tfidf = ____ 

# Apply fit_transform to document: csr_mat
csr_mat = ____

# Print result of toarray() method
print(csr_mat.toarray())

# Get the words: words
words = ____

# Print words
print(words)
แก้ไขและรันโค้ด