大模型安全与对齐:RLHF、DPO还是Constitutional AI?
AI安全是热门话题。RLHF、DPO、Constitutional AI等对齐方法各有什么优劣?
方法对比:
- RLHF:效果好但需要大量人类标注,训练复杂
- DPO:简化了流程,直接偏好优化
- Constitutional AI:用AI自我监督,成本低
- RLHF + 过程奖励:最新趋势
大家觉得哪种对齐方法会成为主流?安全问题会不会成为AI发展的瓶颈?
14
评论 14