K-means để phân cụm phản hồi
Bạn có một tập dữ liệu các phản hồi, và bạn đã dùng một mô hình GPT để tính điểm độ tin cậy cho từng phản hồi. Để phát hiện các phản hồi bất thường hoặc ngoại lai, bạn áp dụng phân cụm k-means cho các phản hồi có độ tin cậy thấp.
Thuật toán KMeans, các biến reviews và confidences, cùng thư viện np đã được nạp sẵn.
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Khởi tạo thuật toán k-means. Đặt
random_statelà42để đảm bảo khả năng tái lập kết quả. - Tính khoảng cách từ các tâm cụm để xác định điểm ngoại lai bằng cách lấy hiệu giữa
datavà các tâm cụm tương ứng.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
def detect_anomalies(data, n_clusters=3):
# Initialize k-means
____
clusters = kmeans.fit_predict(data)
centers = kmeans.cluster_centers_
# Calculate distances from cluster centers
____
return distances
anomalies = detect_anomalies(confidences)
print(anomalies)