Încredere scăzută
În acest exercițiu, vei lucra cu un model de recompensă pentru a evalua cât de sigur clasifică textul de intrare și pentru a filtra predicțiile care nu sunt suficient de fiabile. Scopul este să evaluezi capacitatea modelului de a genera predicții și să aplici un prag de încredere, astfel încât doar predicțiile cu un nivel ridicat de încredere să fie considerate valide.
Distribuțiile de probabilitate pentru fiecare text de feedback (prob_dists), variabila cu textele de feedback (texts) și funcția least_confidence() au fost pre-încărcate.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Definește funcția care filtrează indicii distribuțiilor de probabilitate pentru care nivelul de încredere este sub un prag dat.
- Obține indicii comentariilor de feedback transmițând distribuțiile de probabilitate funcției, fără a modifica pragul implicit (
0.5).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)