K-means สำหรับการจัดกลุ่มข้อมูลฟีดแบ็ก
สมมติว่ามีชุดข้อมูลของคำตอบฟีดแบ็ก และใช้โมเดล GPT คำนวณคะแนนความเชื่อมั่น (confidence score) ให้กับแต่ละคำตอบแล้ว เพื่อค้นหาฟีดแบ็กที่ผิดปกติหรือเป็น outlier จะนำ k-means clustering มาใช้กับคำตอบที่มีคะแนนความเชื่อมั่นต่ำ
อัลกอริทึม KMeans ตัวแปร reviews และ confidences รวมถึงไลบรารี np ได้ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- กำหนดค่าเริ่มต้นให้กับอัลกอริทึม k-means โดยตั้งค่า
random_stateเป็น42เพื่อให้โค้ดได้ผลลัพธ์ที่สามารถทำซ้ำได้ - คำนวณระยะห่างจาก cluster center เพื่อระบุ outlier โดยหาผลต่างระหว่าง
dataกับ cluster center ที่สอดคล้องกัน
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def detect_anomalies(data, n_clusters=3):
# Initialize k-means
____
clusters = kmeans.fit_predict(data)
centers = kmeans.cluster_centers_
# Calculate distances from cluster centers
____
return distances
anomalies = detect_anomalies(confidences)
print(anomalies)