开始使用免费开始使用

在量化模型中加速推理

贵公司一直在用量化后的 Llama 模型为客服聊天机器人提供支持。用户最大的抱怨之一是机器人回复很慢,有时还会给出古怪的答案。

您怀疑这与未做归一化就量化到 4 位有关。在调查中,您还怀疑速度权衡来自推理阶段的计算,因为当前使用的是 32 位浮点数。

您希望调整量化配置,以提升模型的推理速度。以下导入已准备好可用:AutoModelForCausalLMAutoTokenizerBitsAndBytesConfig

本练习是课程的一部分

使用 Llama 3 进行微调

查看课程

练习说明

  • 将量化类型设置为归一化的 4 位,以减少离群值,从而降低无意义回答的概率。
  • 将计算类型设置为 bfloat16,以加快推理计算速度。

交互式实操练习

通过完成这段示例代码来试试这个练习。

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
编辑并运行代码