模型压缩技术盘点:量化、剪枝、蒸馏哪个最实用?
大模型太贵太慢,部署时需要压缩。量化(INT4/INT8)、剪枝、知识蒸馏各有优劣。大家实际用哪种?
我的经验:
- 量化:最实用,GGUF Q4_K_M效果好
- 蒸馏:用大模型教小模型,但需要大量数据
- 剪枝:理论好但实现复杂,效果不稳定
- LoRA:不算压缩但降低了微调成本
各位在部署时怎么平衡效果和成本?
10
评论 10