Inicjalizacja trenera PPO
Pracujesz w firmie obsługi klienta, która korzysta z chatbota do odpowiadania na pytania użytkowników. Chatbot udziela pomocnych odpowiedzi, jednak ostatnio pojawiły się opinie, że brakuje im głębi. Musisz dostroić model stojący za chatbotem – zacznij od utworzenia instancji trenera PPO.
Zbiór danych dataset_cs został już wczytany.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Zainicjalizuj konfigurację PPO z nazwą modelu
"gpt2"i współczynnikiem uczenia równym1.2e-5. - Wczytaj
AutoModelForCausalLMWithValueHead– przyczynowy model językowy z głowicą wartości. - Utwórz
PPOTrainer(), używając zdefiniowanego modelu, konfiguracji i tokenizera oraz wstępnie wczytanego zbioru danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____