Inicjalizacja nagrody
Jesteś na ostatnim etapie wdrażania modelu generatywnego, który ma oferować spersonalizowane rekomendacje dla internetowej księgarni. Aby dopasować ten model do rekomendacji preferowanych przez ludzi, musisz wytrenować model nagrody na zebranych danych preferencji. Pierwszym krokiem jest zainicjalizowanie modelu i parametrów konfiguracyjnych.
AutoTokenizer i AutoModelForSequenceClassification zostały wstępnie załadowane z transformers. RewardConfig zostało wstępnie załadowane z trl.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Załaduj model GPT-1,
"openai-gpt", do zadania klasyfikacji sekwencji, korzystając zAutoModelForSequenceClassificationz Hugging Face. - Zainicjalizuj konfigurację nagrody, używając
"output_dir"jako katalogu wyjściowego, i ustaw maksymalną długość tokenu na60.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)