Začněte nyníZačněte zdarma

Zrychlení inference v kvantizovaných modelech

Tvoje firma už nějakou dobu používá model Llama s kvantizací pro chatbota zákaznické podpory. Jednou z nejčastějších stížností zákazníků je, že bot odpovídá velmi pomalu a občas produkuje nesmyslné odpovědi.

Máš podezření, že příčinou může být kvantizace na 4 bity bez normalizace. Při prošetřování také tušíš, že zpomalení pochází z výpočtů při inferenci, které používají 32bitové floaty.

Chceš upravit konfiguraci kvantizace, aby se rychlost inference zlepšila. Následující importy jsou již načteny: AutoModelForCausalLM, AutoTokenizer a BitsAndBytesConfig.

Toto cvičení je součástí kurzu

Fine-Tuning s Llama 3

Zobrazit kurz

Pokyny k cvičení

  • Nastav typ kvantizace na normalizované 4 bity, čímž omezíš odlehlé hodnoty a model bude produkovat méně nesmyslných odpovědí.
  • Nastav výpočetní typ na bfloat16, aby se urychlily výpočty při inferenci.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
Upravit a spustit kód