Načítání modelů v 8bitech
Tvoje společnost už nějakou dobu používá model Llama pro chatbota zákaznické podpory. Dostal/a jsi za úkol zjistit, jak snížit využití GPU paměti modelu, aniž by to výrazně ovlivnilo jeho výkon. To umožní týmu přejít na levnější výpočetní cluster a ušetřit firmě nemalé peníze.
Rozhodneš se otestovat, jestli lze model načíst s 8bitovou kvantizací a přitom zachovat přijatelný výkon.
Model máš k dispozici v proměnné model_name. AutoModelForCausalLM a AutoTokenizer jsou již naimportované.
Toto cvičení je součástí kurzu
Fine-Tuning s Llama 3
Pokyny k cvičení
- Importuj konfigurační třídu, která umožňuje načítání modelů s kvantizací.
- Vytvoř instanci konfigurační třídy pro kvantizaci.
- Nastav parametry kvantizace tak, aby se model načetl v 8bitech.
- Předej konfiguraci kvantizace do
AutoModelForCausalLMpro načtení kvantizovaného modelu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)