K-means för klustring av feedback
Du har en datamängd med feedbacksvar och har använt en GPT-modell för att beräkna konfidenspoäng för varje svar. För att identifiera ovanliga svar eller avvikare tillämpar du k-means-klustring på svaren med låg konfidenspoäng.
Algoritmen KMeans, variablerna reviews och confidences samt biblioteket np har förinslästs.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Initiera k-means-algoritmen. Ange
random_statetill42för att säkerställa reproducerbarhet. - Beräkna avstånden från klustercentrum för att identifiera avvikare som skillnaden mellan
dataoch motsvarande klustercentrum.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def detect_anomalies(data, n_clusters=3):
# Initialize k-means
____
clusters = kmeans.fit_predict(data)
centers = kmeans.cluster_centers_
# Calculate distances from cluster centers
____
return distances
anomalies = detect_anomalies(confidences)
print(anomalies)