開始使用免費開始

在量化模型中加速推論

你的公司已經用量化過的 Llama 模型來做客服聊天機器人一段時間了。你們收到的一大抱怨是機器人回覆很慢,而且有時會產生怪異的答案。

你懷疑這與沒有正規化就量化到 4 位元有關。在調查中,你也懷疑速度上的取捨來自推論計算,因為目前使用的是 32 位元浮點數。

你想調整量化設定來提升模型的推論速度。以下匯入已經載入:AutoModelForCausalLMAutoTokenizerBitsAndBytesConfig

本練習屬於課程

使用 Llama 3 進行微調

檢視課程

練習說明

  • 將量化型別設為正規化的 4 位元,以降低離群值,進而減少不合邏輯的答案。
  • 將運算型別設為 bfloat16,以加快推論計算速度。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
編輯並執行程式碼