K-means для кластеризации отзывов
У вас есть набор данных с отзывами, и вы использовали модель GPT для вычисления оценок уверенности для каждого ответа. Чтобы выявить нетипичные или аномальные отзывы, примените кластеризацию методом k-средних к ответам с низкой уверенностью.
Алгоритм KMeans, переменные reviews и confidences, а также библиотека np уже загружены.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Инициализируйте алгоритм k-средних. Установите
random_stateравным42для воспроизводимости кода. - Вычислите расстояния от центров кластеров, чтобы определить выбросы — как разницу между
dataи соответствующими центрами кластеров.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
def detect_anomalies(data, n_clusters=3):
# Initialize k-means
____
clusters = kmeans.fit_predict(data)
centers = kmeans.cluster_centers_
# Calculate distances from cluster centers
____
return distances
anomalies = detect_anomalies(confidences)
print(anomalies)