เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การนำ TF-IDF ไปใช้กับคำอธิบายหนังสือ

PyBooks ได้รวบรวมคำอธิบายหนังสือหลายรายการ และต้องการระบุคำสำคัญในคำอธิบายเหล่านั้นโดยใช้เทคนิคการเข้ารหัสแบบ TF-IDF เพื่อให้เข้าใจคุณลักษณะเฉพาะของแต่ละเล่มได้ดียิ่งขึ้น และนำข้อมูลนี้ไปช่วยพัฒนาระบบแนะนำหนังสือ

แพ็กเกจต่อไปนี้ถูก import ไว้ให้แล้ว: torch, torchtext

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Deep Learning สำหรับข้อความด้วย PyTorch

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import คลาส TfidfVectorizer จาก sklearn.feature_extraction.text ซึ่งใช้แปลงชุดเอกสารดิบให้เป็นเมทริกซ์ของฟีเจอร์ TF-IDF
  • สร้างอินสแตนซ์ของคลาสนี้ จากนั้นใช้อินสแตนซ์ดังกล่าวเข้ารหัส descriptions ให้เป็นเมทริกซ์เวกเตอร์แบบ TF-IDF
  • ดึงและแสดงชื่อฟีเจอร์ 5 รายการแรกจาก vectorizer และเวกเตอร์ที่เข้ารหัสแล้วจาก tfidf_encoded_descriptions

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
แก้ไขและรันโค้ด