在量化模型中加速推論
你的公司已經用量化過的 Llama 模型來做客服聊天機器人一段時間了。你們收到的一大抱怨是機器人回覆很慢,而且有時會產生怪異的答案。
你懷疑這與沒有正規化就量化到 4 位元有關。在調查中,你也懷疑速度上的取捨來自推論計算,因為目前使用的是 32 位元浮點數。
你想調整量化設定來提升模型的推論速度。以下匯入已經載入:AutoModelForCausalLM、AutoTokenizer、BitsAndBytesConfig。
本練習屬於課程
使用 Llama 3 進行微調
練習說明
- 將量化型別設為正規化的 4 位元,以降低離群值,進而減少不合邏輯的答案。
- 將運算型別設為 bfloat16,以加快推論計算速度。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)