Začněte nyníZačněte zdarma

Inicializace odměny

Jsi v závěrečné fázi nasazení generativního modelu, který nabízí personalizovaná doporučení pro online knihkupectví. Aby model odpovídal doporučením preferovaným lidmi, potřebuješ natrénovat model odměny pomocí shromážděných dat o preferencích. Prvním krokem je inicializace modelu a konfiguračních parametrů.

AutoTokenizer a AutoModelForSequenceClassification byly předem načteny z transformers. RewardConfig byl předem načten z trl.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Načti model GPT-1, "openai-gpt", pro úlohu klasifikace sekvencí pomocí AutoModelForSequenceClassification z Hugging Face.
  • Inicializuj konfiguraci odměny s "output_dir" jako výstupním adresářem a nastav maximální délku tokenu na 60.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
Upravit a spustit kód