开始使用免费开始使用

加载 8 位模型

贵公司一直在为客服聊天机器人使用一款 Llama 模型。现在,您需要在尽量不影响性能的前提下,降低该模型的 GPU 内存占用。这将使团队能够切换到更便宜的计算集群,为公司节省大量成本。

您决定测试是否可以用 8 位量化来加载模型,同时保持可接受的性能。

给定的模型名称保存在 model_name 中。AutoModelForCausalLMAutoTokenizer 已为您导入。

本练习是课程的一部分

使用 Llama 3 进行微调

查看课程

练习说明

  • 导入用于启用量化加载的配置类。
  • 实例化量化配置类。
  • 设置量化参数,使模型以 8 位加载。
  • 将量化配置传递给 AutoModelForCausalLM 来加载量化后的模型。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
编辑并运行代码