RLHF
/ˌɑːr el eɪtʃ ˈef/人类反馈强化学习跟读一遍
艾勒·艾勒·艾尺·艾夫
点「跟读」听中文慢速念法——记住这一串,开口不慌。
请人给回答打分,教 AI 越来越讨人喜欢。
人话解释
RLHF 全称 Reinforcement Learning from Human Feedback。流程大致三步:先让人对同一问题的多个回答排序打分;再用这些评分训练一个「裁判模型」;最后让大模型朝着裁判打高分的方向持续优化自己。ChatGPT 之所以说话讨喜、懂得礼貌拒绝危险请求,背后都有 RLHF 训练出来的分寸感。
例带新人见客户:每封邮件主管都逐段批注哪里加分、哪里尴尬,三个月后新人自然学会了职场分寸。