案例库 · 研发与科研 · 技术决策 · 2022
OpenAI 用人类反馈引导 GPT-3,小模型胜过大模型
InstructGPT 在人类示范和排名上微调了 GPT-3,使得 1.3B 参数模型在遵循指令上优于 175B 参数的 GPT-3。
OpenAI
那一手
语言模型越大,在基准测试上能力越强,但未必更有帮助、更真实或更安全。模型可能生成自信的胡言乱语或有毒文本,但仍在训练目标上表现良好,因此直接增加模型大小并不是正确解决用户意图的方法。
OpenAI 的答案是通过人工干预而非增加参数。标注者写了他们所期望行为的样例,用这些样例对 GPT-3 进行微调;然后标注者对多个模型输出进行排序,排序结果成为奖励信号,模型进一步训练以最大化这个奖励。
得到的 InstructGPT 在人类评估中远更符合意图:它的输出比 175B 参数 GPT-3 的输出更受青睐,即便获胜的模型只有 1.3B 参数,小了约百倍。
同时它更真实、更有毒,在公开 NLP 基准上几乎不输。重点不在模型大小,而在于为它收集的反馈质量。
为什么管用
- 人类的偏好排序为“有帮助、诚实、无害”提供了清晰的奖励,而原始文本上的下一个 token 预测无法捕捉这一点。
- 偏好数据远比模型参数便宜,因此相对少量的数据就能让模型有很大的进步。
- 同样的方法适用于不同任务,因为它调整的是模型的判断力,而非单一技能。
- 提高对齐度使更好、更小的模型成为人们真正想用的模型,同时降低了服务成本。
值了多少根据人类偏好评分,而非模型大小神来之笔
可以搬走什么
对齐是数据和反馈问题,而不仅仅是规模问题——把预算花在收集正确的信号上,可能比花在更多参数上更有效。
后来呢
基于人类反馈的强化学习成为将预训练模型转化为助手的标准方式,这是 2020 年代中期聊天助手背后的技术。收集偏好数据的价值可能超过扩展参数,这一想法重塑了模型提供商分配精力和计算资源的方式。
资料来源
- Training language models to follow instructions with human feedback
- Reinforcement learning from human feedback
发现哪里写错了?告诉我们。