简体中文
外观
234 字小于 1 分钟
domain/aiai/llm
2026-07-24
RLHF:基于人类反馈的强化学习,优化模型输出符合人类偏好 奖励模型:学习人类偏好的评分模型,用于指导强化学习 DPO:直接偏好优化,无需训练奖励模型的对齐方法 Constitutional AI:通过自我修正实现对齐的方法