ПочатиПочніть безкоштовно

Оцінювання кластеризації зерна

У попередній вправі ви побачили з графіка інерції, що 3 — це добра кількість кластерів для даних про зерно. Насправді зразки походять із суміші трьох різних сортів: «Kama», «Rosa» та «Canadian». У цій вправі виконайте кластеризацію зразків на три кластери та порівняйте їх із сортами за допомогою перехресної таблиці.

У вас є масив samples із зразками та список varieties із назвою сорту для кожного зразка. Pandas (pd) і KMeans уже імпортовано.

Ця вправа є частиною курсу

Наглядове навчання в Python

Переглянути курс

Інструкції до вправи

  • Створіть модель KMeans з назвою model із 3 кластерами.
  • Скористайтеся методом .fit_predict() об'єкта model, щоб навчити його на samples і отримати мітки кластерів. Використання .fit_predict() еквівалентне послідовності .fit() і .predict().
  • Створіть датафрейм df із двома стовпцями з назвами 'labels' і 'varieties', використавши відповідно labels і varieties як значення стовпців. Це вже зроблено за вас.
  • Використайте функцію pd.crosstab() для df['labels'] і df['varieties'], щоб підрахувати, скільки разів кожен сорт зерна збігається з кожною міткою кластера. Присвойте результат змінній ct.
  • Натисніть «Надіслати відповідь», щоб побачити перехресну таблицю!

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a KMeans model with 3 clusters: model
model = ____

# Use fit_predict to fit model and obtain cluster labels: labels
labels = ____

# Create a DataFrame with labels and varieties as columns: df
df = pd.DataFrame({'labels': labels, 'varieties': varieties})

# Create crosstab: ct
ct = ____

# Display ct
print(ct)
Редагувати та запускати код