Bắt đầu ngayBắt đầu miễn phí

Biểu diễn TF-IDF cho phản hồi sản phẩm

Bạn đang làm việc với đội ngũ hỗ trợ khách hàng tại một công ty nhà thông minh. Họ đã thu thập phản hồi của người dùng về nhiều thiết bị thông minh và muốn xác định những từ nào nổi bật trong mỗi bài đánh giá. Bạn đề xuất sử dụng kỹ thuật TF-IDF để làm nổi bật các thuật ngữ liên quan nhất trong các phản hồi. Hãy giúp họ bắt đầu nào!

Một hàm preprocess() nhận vào văn bản và trả về văn bản đã xử lý đã được nạp sẵn cho bạn. Hàm này thực hiện chuyển về chữ thường, tách từ, và loại bỏ dấu câu. Pandas đã được import là pd, và lớp TfidfVectorizer đã sẵn sàng để dùng.

Bài tập này là một phần của khóa học

Natural Language Processing (NLP) bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo một TF-IDF vectorizer.
  • Biến đổi các đánh giá đã làm sạch thành tfidf_matrix.
  • Tạo một DataFrame df cho tfidf_matrix, với các từ vựng làm tên cột.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Chỉnh sửa và Chạy Mã