Bắt đầu ngayBắt đầu miễn phí

Đánh giá văn bản sinh ra bằng ROUGE

Bạn được cung cấp 10 mẫu từ một bộ dữ liệu hỏi-đáp (Softage-AI/sft-conversational_dataset).

Bạn đã dùng TinyLlama-1.1B để tạo câu trả lời cho các mẫu này, và nhiệm vụ của bạn là đánh giá chất lượng kết quả sinh ra so với đáp án chuẩn.

Các câu trả lời do mô hình tạo ra nằm trong test_answers và đáp án chuẩn nằm trong reference_answers. Hãy dùng các chỉ số đánh giá ROUGE để đánh giá chất lượng phần sinh của mô hình.

Bài tập này là một phần của khóa học

Fine-Tuning với Llama 3

Xem khóa học

Hướng dẫn bài tập

  • Import lớp đánh giá và metric (metric ROUGE).
  • Khởi tạo lớp đánh giá và tải metric ROUGE.
  • Chạy instance evaluator với reference_answerstest_answers đã cho để tính điểm ROUGE.
  • Lưu vào final_score điểm từ kết quả dùng để kiểm tra mức trùng lặp các cặp từ giữa câu trả lời chuẩn và câu trả lời được sinh ra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
Chỉnh sửa và Chạy Mã