在量化模型中加速推理
贵公司一直在用量化后的 Llama 模型为客服聊天机器人提供支持。用户最大的抱怨之一是机器人回复很慢,有时还会给出古怪的答案。
您怀疑这与未做归一化就量化到 4 位有关。在调查中,您还怀疑速度权衡来自推理阶段的计算,因为当前使用的是 32 位浮点数。
您希望调整量化配置,以提升模型的推理速度。以下导入已准备好可用:AutoModelForCausalLM、AutoTokenizer 和 BitsAndBytesConfig。
本练习是课程的一部分
使用 Llama 3 进行微调
练习说明
- 将量化类型设置为归一化的 4 位,以减少离群值,从而降低无意义回答的概率。
- 将计算类型设置为 bfloat16,以加快推理计算速度。
交互式实操练习
通过完成这段示例代码来试试这个练习。
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)