Zrychlení inference v kvantizovaných modelech
Tvoje firma už nějakou dobu používá model Llama s kvantizací pro chatbota zákaznické podpory. Jednou z nejčastějších stížností zákazníků je, že bot odpovídá velmi pomalu a občas produkuje nesmyslné odpovědi.
Máš podezření, že příčinou může být kvantizace na 4 bity bez normalizace. Při prošetřování také tušíš, že zpomalení pochází z výpočtů při inferenci, které používají 32bitové floaty.
Chceš upravit konfiguraci kvantizace, aby se rychlost inference zlepšila. Následující importy jsou již načteny: AutoModelForCausalLM, AutoTokenizer a BitsAndBytesConfig.
Toto cvičení je součástí kurzu
Fine-Tuning s Llama 3
Pokyny k cvičení
- Nastav typ kvantizace na normalizované 4 bity, čímž omezíš odlehlé hodnoty a model bude produkovat méně nesmyslných odpovědí.
- Nastav výpočetní typ na bfloat16, aby se urychlily výpočty při inferenci.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)