要回答“哪个结果更适合我”,先定义自己的工作,再设计评分。一个与任务无关的总榜分数,不能告诉你这份材料是否被处理正确。
先写关键失败条件
以将活动材料整理成通知为例,可以把“编造活动日期”“漏掉必须报名”“泄露不应公开的联系人信息”设为关键失败。一旦出现,就先判本次结果不可采用,不能用文风优美的得分抵消。
这些条件应在阅读候选结果之前写好,否则容易在看过偏爱的答案后移动标准。一次失败也不证明某个模型永远不可用,它只说明本次结果不满足这个任务。
选择四个能说明工作量的维度
| 维度 | 权重 | 0 分 | 3 分 | 5 分 |
|---|---|---|---|---|
| 事实与材料一致 | 40 | 核心事实错 | 有可修正遗漏 | 本样本无事实性改动需求 |
| 格式与指令遵循 | 20 | 无法进入流程 | 需手工整理 | 符合指定格式 |
| 修改工作量 | 20 | 基本重写 | 需要局部调整 | 无实质修改 |
| 时间与成本适配 | 20 | 超过任务可接受范围 | 勉强可接受 | 符合预设范围 |
这是示范量表,不是通用行业标准。“事实一致”和“修改工作量”可能相关,使用时可以调整维度,避免反复奖励同一件事。时间与成本的分数需要先设定自己的可接受范围。
算一次完整例子
下面是人为设定的教学分数,不是任何模型的测试成绩:
A:5、4、3、2 B:3、4、5、2 A = (40×5 + 20×4 + 20×3 + 20×2) ÷ 100 = 3.8 B = (40×3 + 20×4 + 20×5 + 20×2) ÷ 100 = 3.4
在这组权重下 A 更高。如果你的工作更依赖修改速度,调高“修改工作量”的权重,结果可能变化。权重表达的是任务偏好,不是产品的固有能力。
高分却不能采用的情况
假设 A 的格式很好,但编造了一个报名截止日期。即使其他维度让平均分仍然很高,也必须触发先前设定的关键失败条件。比较器会保留分数供分析,同时提示不能仅按分数选取该结果。
让比较更可复现
- 保存同一份材料、同一提示词以及模型或工具的版本信息。
- 选取正常案例、边界案例与缺失信息案例,不只测最容易的一个问题。
- 先隐藏结果来自哪一方,再按预设规则评分,减少品牌偏好。
- 保留原始输出、修改记录和关键失败说明,不只保存最后的平均分。
- 有条件时由另一人独立打分;分歧本身能指出评分标准不清的地方。
少量任务和主观评分无法支持“全面最好”的结论。合适的结论是“在这组材料、条件与评分规则下,哪个结果更符合需求”。版本或材料发生变化后,应重新测试。
动手练习 · 原创教学样例
换一组权重,结论会变吗?
仍用 A=5、4、3、2,B=3、4、5、2,把权重改为 20、20、40、20。先手算,再用比较器核对。
完成后查看参考解析
A=(100+80+120+40)/100=3.4;B=(60+80+200+40)/100=3.8。排序反转是因为偏好变化,不是候选结果自己发生了变化;关键失败仍不能靠总分抵消。
检查要点
输入相同输出;只改权重;记录改变理由,而不是为偏好的候选事后调权。
先尝试再对照。参考解析用于教学,不是实际产品测试记录。
发现内容有误?提供原句和依据,帮助我们纠正。