Začněte nyníZačněte zdarma

Načítání modelů v 8bitech

Tvoje společnost už nějakou dobu používá model Llama pro chatbota zákaznické podpory. Dostal/a jsi za úkol zjistit, jak snížit využití GPU paměti modelu, aniž by to výrazně ovlivnilo jeho výkon. To umožní týmu přejít na levnější výpočetní cluster a ušetřit firmě nemalé peníze.

Rozhodneš se otestovat, jestli lze model načíst s 8bitovou kvantizací a přitom zachovat přijatelný výkon.

Model máš k dispozici v proměnné model_name. AutoModelForCausalLM a AutoTokenizer jsou již naimportované.

Toto cvičení je součástí kurzu

Fine-Tuning s Llama 3

Zobrazit kurz

Pokyny k cvičení

  • Importuj konfigurační třídu, která umožňuje načítání modelů s kvantizací.
  • Vytvoř instanci konfigurační třídy pro kvantizaci.
  • Nastav parametry kvantizace tak, aby se model načetl v 8bitech.
  • Předej konfiguraci kvantizace do AutoModelForCausalLM pro načtení kvantizovaného modelu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
Upravit a spustit kód