Låg konfidens
I den här övningen arbetar du med en belöningsmodell för att bedöma hur säkert den klassificerar indata och för att filtrera bort förutsägelser som saknar tillförlitlighet. Målet är att utvärdera modellens förmåga att generera förutsägelser och att tillämpa ett konfidenströskel så att endast förutsägelser med hög konfidens betraktas som giltiga.
Sannolikhetsfördelningarna för varje återkopplingstext (prob_dists), variabeln för återkopplingstext (texts) och funktionen least_confidence() har laddats in i förväg.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Definiera funktionen för att filtrera index för sannolikhetsfördelningar där konfidensen understiger ett givet tröskelvärde.
- Hämta index för återkopplingskommentarerna genom att skicka sannolikhetsfördelningarna till funktionen och lämna tröskelvärdet oförändrat (
0.5).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)