Hlasování většiny z více datových zdrojů
Tvůj tým vyvíjí model AI pro automatické generování zpráv o kontrole kvality (QC) chytrých telefonů. Za tímto účelem jste shromáždili preferenční data ze tří různých zdrojů kontroly kvality – „Automatizovaného vizuálního systému", „Lidského inspektora" a „Zpětné vazby od zákazníků". Každý zdroj označil dvojice textových vzorků jako „chosen" a „rejected". Každá dvojice má jedinečné „id" a každý záznam představuje preferovanou QC recenzi.
quality_df je kombinovaný DataFrame načtený pomocí pandas. Obsahuje data ze tří různých datových zdrojů. Třída Counter je navíc předem naimportována z modulu collections.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Ve funkci vote spočítej výskyty každé dvojice (chosen, rejected).
- Najdi dvojici (chosen, rejected) s nejvyšším počtem hlasů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def majority_vote(df):
# Count occurrences of each (chosen, rejected) pair
votes = ____
# Find the (chosen, rejected) pair with the highest vote count
winner = ____
return winner
final_preferences = quality_df.groupby(['id']).apply(majority_vote)
print(final_preferences)