載入 8-bit 模型
你的公司已經用 Llama 模型來支援客服聊天機器人一段時間了。現在你被指派評估如何在不明顯影響效能的前提下,降低模型的 GPU 記憶體用量。這能讓團隊改用更便宜的運算叢集,為公司省下一大筆成本。
你決定測試是否能以 8-bit 量化載入模型,同時維持合理的效能。
變數 model_name 提供了模型名稱。AutoModelForCausalLM 與 AutoTokenizer 已替你匯入完成。
本練習屬於課程
使用 Llama 3 進行微調
練習說明
- 匯入可啟用量化載入的設定類別。
- 實例化量化設定類別。
- 設定量化參數,讓模型以 8-bit 載入。
- 將量化設定傳入
AutoModelForCausalLM,以載入量化後的模型。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)