RLHF-PPO的缺点
- 两阶段训练带来的信息损失:RLHF 的过程是先利用偏好数据训练一个奖励函数模型,然后再用 PPO 或者其他强化学习算法训练最后的策略。这个过程中如果奖励函数模型学习存在偏差,比如奖励实际上并没有和人类偏好对齐的很好,那么后续的强化学习过程也会导致策略陷入次优
- PPO 算法带来的额外训练资源需求:强化学习的训练会伴随着探索和利用(explore and exploit)的过程,一般会比较不稳定。PPO 引入了 Actor、Critic、Reward 和 Reference 四个模型,在传统强化学习环境中,Actor 和 Critic 以及 Reference 都是简单的网络实现,reward 是环境自带的人为设计好的,所以并不存在大规模的资源需求,而到了 LLM 这里,所有的模型都是基于 LLM(SFT)模型初始化或者改进的,那么即使在 PPO 训练过程中只有 Actor 和 Critic 需要更新参数,四个模型的推理和训练就需要大量的计算资源,以及四个模型也会带来更多的累积误差
