Inicializace odměny
Jsi v závěrečné fázi nasazení generativního modelu, který nabízí personalizovaná doporučení pro online knihkupectví. Aby model odpovídal doporučením preferovaným lidmi, potřebuješ natrénovat model odměny pomocí shromážděných dat o preferencích. Prvním krokem je inicializace modelu a konfiguračních parametrů.
AutoTokenizer a AutoModelForSequenceClassification byly předem načteny z transformers. RewardConfig byl předem načten z trl.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Načti model GPT-1,
"openai-gpt", pro úlohu klasifikace sekvencí pomocíAutoModelForSequenceClassificationz Hugging Face. - Inicializuj konfiguraci odměny s
"output_dir"jako výstupním adresářem a nastav maximální délku tokenu na60.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)