Inicializace PPO trenéra
Pracuješ pro společnost zákaznické podpory, která využívá chatbota ke zpracování dotazů zákazníků. Chatbot poskytuje užitečné odpovědi, ale nedávno jsi dostal/a zpětnou vazbu, že jim chybí hloubka. Potřebuješ doladit model, který za chatbotem stojí, a začínáš vytvořením instance PPO trenéra.
dataset_cs je již načtený.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Inicializuj PPO konfiguraci s názvem modelu
"gpt2"a learning rate1.2e-5. - Načti
AutoModelForCausalLMWithValueHead– kauzální jazykový model s value head. - Vytvoř
PPOTrainer()pomocí modelu, konfigurace a tokenizéru, které jsi právě definoval/a, a s předem načteným datasetem.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____