AI概念
人类反馈强化学习
RLHF
用人类偏好信号训练奖励模型,再优化策略以对齐有用与无全输出。
- scenarios
- ["对话对齐","安全策略"]
详细说明
简单解释:让人给回答打分,模型学会更符合人类喜好的答法。
专业解释:Reinforcement Learning from Human Feedback 是对齐常用路径之一,也有 DPO 等替代方法。
描述来源标记:原始/编辑整理
继续探索
基于知识图谱关系,发现相关AI概念与跨分类内容。
AI概念
RLHF
用人类偏好信号训练奖励模型,再优化策略以对齐有用与无全输出。
描述来源标记:原始/编辑整理
基于知识图谱关系,发现相关AI概念与跨分类内容。