1. Learn
  2. /
  3. Курси
  4. /
  5. Основи Big Data з PySpark

Connected

Вправа

Візуалізація кластерів

Ви щойно натренували модель k-means з оптимальним значенням k (k=16) і отримали центри кластерів (центроїди). У цій фінальній вправі ви візуалізуєте кластери та центроїди, наклавши їх один на одного. Це покаже, наскільки вдало спрацювало кластеризування (ідеально, якщо кластери чітко відрізняються між собою, а центроїди розташовані в центрі відповідних кластерів).

Щоб це зробити, спочатку перетворіть RDD rdd_split_int на Spark DataFrame, а потім на pandas DataFrame, який можна використати для побудови графіків. Так само перетворіть cluster_centers на pandas DataFrame. Коли обидва DataFrame буде створено, побудуйте діаграми розсіювання за допомогою Matplotlib.

У вашому робочому середовищі доступні SparkContext sc, змінні rdd_split_int і cluster_centers, а також пакет matplotlib.pyplot (імпортований як plt).

Інструкції

100 XP
  • Перетворіть RDD rdd_split_int на Spark DataFrame, а потім на pandas DataFrame.
  • Створіть pandas DataFrame зі списку cluster_centers.
  • Побудуйте діаграму розсіювання з pandas DataFrame сирих даних (rdd_split_int_df_pandas) і накладіть на неї діаграму розсіювання з Pandas DataFrame центроїдів (cluster_centers_pandas).