開始使用免費開始

載入 8-bit 模型

你的公司已經用 Llama 模型來支援客服聊天機器人一段時間了。現在你被指派評估如何在不明顯影響效能的前提下,降低模型的 GPU 記憶體用量。這能讓團隊改用更便宜的運算叢集,為公司省下一大筆成本。

你決定測試是否能以 8-bit 量化載入模型,同時維持合理的效能。

變數 model_name 提供了模型名稱。AutoModelForCausalLMAutoTokenizer 已替你匯入完成。

本練習屬於課程

使用 Llama 3 進行微調

檢視課程

練習說明

  • 匯入可啟用量化載入的設定類別。
  • 實例化量化設定類別。
  • 設定量化參數,讓模型以 8-bit 載入。
  • 將量化設定傳入 AutoModelForCausalLM,以載入量化後的模型。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
編輯並執行程式碼