Vyhodnocení modelu na vlastní datové sadě
V tomto cvičení použiješ evaluator z balíčku evaluate od Hugging Face, abys zhodnotil/a výkon předtrénovaného modelu na vlastní datové sadě. Měj na paměti, že při vícetřídní klasifikaci s nevyváženými daty není přesnost (accuracy) spolehlivým ukazatelem výkonu. Proto využiješ schopnost evaluátoru poskytovat více metrik najednou: přesnost (precision) a úplnost (recall).
Dataset (dataset) a pipeline (pipe) jsou předem definovány. Knihovna evaluate i třída evaluator jsou již naimportovány.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Vytvoř instanci
evaluatorpro úlohu"image-classification". - Extrahuj mapování celočíselných hodnot na textové popisky z pipeline.
- Vyhodnoť dataset (
dataset) a pipeline (pipe) pomocí metrik uložených vmetrics_dictalabel_map.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Instantiate the task evaluator
task_evaluator = ____("____")
task_evaluator.METRIC_KWARGS = {"average": "weighted"}
# Get label map from pipeline
label_map = pipe.model.config.____
# Compute the metrics
eval_results = task_evaluator.____(model_or_pipeline=pipe, data=dataset,
metric=evaluate.____(metrics_dict), label_mapping=____)
print(f"Precision: {eval_results['precision']:.2f}, Recall: {eval_results['recall']:.2f}")