Niska pewność
W tym ćwiczeniu będziesz pracować z modelem nagrody, aby ocenić, z jaką pewnością klasyfikuje on tekst wejściowy, oraz aby odfiltrować predykcje, które nie są wystarczająco wiarygodne. Celem jest sprawdzenie zdolności modelu do generowania predykcji i zastosowanie progu pewności, tak by za trafne uznawać tylko predykcje o wysokiej pewności.
Wczytano następujące zmienne: rozkłady prawdopodobieństwa dla każdego tekstu z informacją zwrotną (prob_dists), teksty z informacją zwrotną (texts) oraz funkcję least_confidence().
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Zdefiniuj funkcję, która filtruje indeksy tych rozkładów prawdopodobieństwa, dla których pewność jest poniżej zadanego progu.
- Pobierz indeksy komentarzy z informacją zwrotną, przekazując rozkłady prawdopodobieństwa do funkcji i pozostawiając próg bez zmian (
0.5).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)