技术笔记

推理模型评测:结果正确性与组内优势

推理模型可能生成较长的中间文本,但文字长度不能替代正确率。

2026年5月20日阅读约 2 分钟
强化学习推理评测

应该评测什么

推理模型可能生成较长的中间文本,但文字长度不能替代正确率。数学任务可以通过可验证答案评估,代码任务需要执行测试;开放问题则需要明确评分标准,并避免将同一个模型的自评当作独立事实。

DeepSeek-R1 论文讨论通过强化学习改进推理能力的训练过程。产品接入时,模型提供的推理摘要也不等同于完整内部计算过程。界面应优先展示答案、证据和错误处理,不应把思考动画当作质量认证。

组内优势的简化计算

对同一个问题采样多个结果后,可用组内奖励均值和标准差归一化奖励。以下只是归一化步骤,不包含策略比率、裁剪、KL 项或任何训练更新,不能称为完整 GRPO 实现。

import assert from "node:assert/strict";
function advantages(rewards) {
  if (!rewards.length) return [];
  const mean = rewards.reduce((a,b) => a+b, 0) / rewards.length;
  const variance = rewards.reduce((a,b) => a+(b-mean)**2, 0) / rewards.length;
  const scale = Math.sqrt(variance);
  return rewards.map(r => scale === 0 ? 0 : (r-mean)/scale);
}
assert.deepEqual(advantages([1,1,1]), [0,0,0]);
assert.deepEqual(advantages([0,1]), [-1,1]);

奖励与数据泄漏风险

奖励函数可能被投机利用。例如代码通过可见测试,并不保证隐藏边缘用例正确。将测试答案、预期输出或未来执行结果放进提示词,会污染评估。样本应区分训练来源、开发集和冻结测试集,并保存版本。

在相同题集上记录准确率、超时率、输出 token 和总延迟。失败应分类为推理错误、格式错误、工具错误和资源限制,不能把所有失败都用“再思考一次”处理。

原始资料

  • DeepSeek-R1:强化学习与推理能力的研究报告。本文没有运行该模型的训练或基准复现。

感谢阅读本文

如果你觉得内容有帮助,欢迎点赞支持或分享给同行开发者。

353 次阅读66 人赞过