НачатьНачать бесплатно

K-means для кластеризации отзывов

У вас есть набор данных с отзывами, и вы использовали модель GPT для вычисления оценок уверенности для каждого ответа. Чтобы выявить нетипичные или аномальные отзывы, примените кластеризацию методом k-средних к ответам с низкой уверенностью.

Алгоритм KMeans, переменные reviews и confidences, а также библиотека np уже загружены.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте алгоритм k-средних. Установите random_state равным 42 для воспроизводимости кода.
  • Вычислите расстояния от центров кластеров, чтобы определить выбросы — как разницу между data и соответствующими центрами кластеров.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

def detect_anomalies(data, n_clusters=3):
    # Initialize k-means
    ____
    clusters = kmeans.fit_predict(data)
    centers = kmeans.cluster_centers_

    # Calculate distances from cluster centers
    ____
    return distances
  
anomalies = detect_anomalies(confidences)
print(anomalies)
Редактировать и запускать код