เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

K-means สำหรับการจัดกลุ่มข้อมูลฟีดแบ็ก

สมมติว่ามีชุดข้อมูลของคำตอบฟีดแบ็ก และใช้โมเดล GPT คำนวณคะแนนความเชื่อมั่น (confidence score) ให้กับแต่ละคำตอบแล้ว เพื่อค้นหาฟีดแบ็กที่ผิดปกติหรือเป็น outlier จะนำ k-means clustering มาใช้กับคำตอบที่มีคะแนนความเชื่อมั่นต่ำ

อัลกอริทึม KMeans ตัวแปร reviews และ confidences รวมถึงไลบรารี np ได้ถูกโหลดไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

คำแนะนำการฝึกหัด

  • กำหนดค่าเริ่มต้นให้กับอัลกอริทึม k-means โดยตั้งค่า random_state เป็น 42 เพื่อให้โค้ดได้ผลลัพธ์ที่สามารถทำซ้ำได้
  • คำนวณระยะห่างจาก cluster center เพื่อระบุ outlier โดยหาผลต่างระหว่าง data กับ cluster center ที่สอดคล้องกัน

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

def detect_anomalies(data, n_clusters=3):
    # Initialize k-means
    ____
    clusters = kmeans.fit_predict(data)
    centers = kmeans.cluster_centers_

    # Calculate distances from cluster centers
    ____
    return distances
  
anomalies = detect_anomalies(confidences)
print(anomalies)
แก้ไขและรันโค้ด