AI搜索

AI概念

人类反馈强化学习

RLHF

用人类偏好信号训练奖励模型,再优化策略以对齐有用与无全输出。

更新:2026/9/28 02:41:58首次收录:2026/9/28 02:41:58原始来源
scenarios
["对话对齐","安全策略"]

详细说明

简单解释:让人给回答打分,模型学会更符合人类喜好的答法。 专业解释:Reinforcement Learning from Human Feedback 是对齐常用路径之一,也有 DPO 等替代方法。

描述来源标记:原始/编辑整理

继续探索

基于知识图谱关系,发现相关AI概念与跨分类内容。