研究问题
RLHF 的效果直接受奖励模型影响,但主流奖励模型基准通常隐含一个前提:同一个问题存在一套统一的「更好回答」标准。真实用户并非如此——有人偏好简洁,有人需要详细;有人希望技术化解释,有人更在意通俗易懂。
作为第一作者,我主导问题定义、数据构建和实验设计,提出 RMGAP(Reward Model Generalization Across Preferences),集中回答一个问题:
当提示词明确表达了不同用户偏好时,奖励模型能否随偏好变化,正确重排同一任务下的候选回答?
这与一般的「回答质量评测」不同。RMGAP 不只问哪条回复总体更好,而是要求模型理解此刻是哪一种偏好在起作用。
四阶段数据构建流程
论文封面图展示了完整生产管线:
- 种子筛选:从 7 个公开数据集收集 Chat、Writing、Reasoning、Safety 四类任务,经过去重、正则过滤和质量筛选,清洗得到 3,371 条种子提示。
- 多风格回复生成:建立包含正式度、简洁度、技术性、客观性和结构连贯性的五维语言风格空间;为每条种子选择彼此差异足够大的风格组合,由 7 个前沿 LLM 生成候选回复。
- 定向提示构造:不是把风格标签直接塞进模板,而是让模型比较四条回复之间真正存在的差异,为每条回复反向构造一个只偏好它的目标提示,再生成两个语义等价的改写版本。
- 质量控制:通过同义一致性、推理正确性和 LLM-as-judge 双评审 + 仲裁,过滤目标不明确、语义漂移或答案本身错误的样本。
最终数据集包含 1,097 个评测实例、4,388 条风格化回复和 13,164 条定向提示。每个实例都把「任务内容」和「偏好表达」分开控制,从而可以单独测量模型是否真正理解偏好。
指标与实验
RMGAP 从三个层面衡量模型:
- Pairwise Accuracy:在目标回复和其他回复两两比较时,模型能否选对。
- Best-of-N Accuracy:面对全部候选时,模型能否把目标偏好的回复排在第一。
- Ranking Consistency:同一偏好的不同提示改写,是否得到稳定一致的排序。
实验覆盖 24 个奖励模型配置,参数规模从 7B 到 685B。即使是表现最好的模型,Best-of-N 准确率也只有 49.27%;235B 和 685B 级模型没有显示出稳定的规模优势。
研究结论
结果说明,当前奖励模型的主要短板并不只是「模型不够大」,而是评分机制还不能稳定地把用户表达的偏好映射到排序变化上。这意味着:
- 个性化助手不能只依赖一个通用奖励分数;
- 产品选型需要测试模型对偏好条件变化的敏感性,而非只看总体榜单;
- 未来的奖励建模应显式表示用户或情境,而不是继续把人类偏好压成单一标量。