Začněte nyníZačněte zdarma

Vyhodnocení modelu na vlastní datové sadě

V tomto cvičení použiješ evaluator z balíčku evaluate od Hugging Face, abys zhodnotil/a výkon předtrénovaného modelu na vlastní datové sadě. Měj na paměti, že při vícetřídní klasifikaci s nevyváženými daty není přesnost (accuracy) spolehlivým ukazatelem výkonu. Proto využiješ schopnost evaluátoru poskytovat více metrik najednou: přesnost (precision) a úplnost (recall).

Dataset (dataset) a pipeline (pipe) jsou předem definovány. Knihovna evaluate i třída evaluator jsou již naimportovány.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci evaluator pro úlohu "image-classification".
  • Extrahuj mapování celočíselných hodnot na textové popisky z pipeline.
  • Vyhodnoť dataset (dataset) a pipeline (pipe) pomocí metrik uložených v metrics_dict a label_map.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Instantiate the task evaluator
task_evaluator = ____("____")

task_evaluator.METRIC_KWARGS = {"average": "weighted"}

# Get label map from pipeline
label_map = pipe.model.config.____

# Compute the metrics
eval_results = task_evaluator.____(model_or_pipeline=pipe, data=dataset, 
                         metric=evaluate.____(metrics_dict), label_mapping=____)

print(f"Precision: {eval_results['precision']:.2f}, Recall: {eval_results['recall']:.2f}")
Upravit a spustit kód