Nízká míra jistoty
V tomto cvičení budeš pracovat s modelem odměn a vyhodnocovat, jak jistě klasifikuje vstupní text. Zároveň odfiltrujete predikce, které nejsou dostatečně spolehlivé. Cílem je otestovat schopnost modelu generovat predikce a pomocí prahu jistoty zajistit, aby byly za platné považovány jen ty s dostatečně vysokou spolehlivostí.
Proměnné s rozděleními pravděpodobností pro každý text zpětné vazby (prob_dists) a samotné texty zpětné vazby (texts) jsou již načteny, stejně jako funkce least_confidence().
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Definuj funkci, která vyfiltruje indexy těch rozdělení pravděpodobností, jejichž míra jistoty je nižší než zadaný práh.
- Získej indexy komentářů zpětné vazby tak, že předáš rozdělení pravděpodobností do funkce a ponecháš práh beze změny (
0.5).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)