← 所有学习指南

选择方法 / 约 7 分钟

比较两个 AI 结果:先定失败条件,再算分

完整算一张比较表,并解释为什么高总分也不能抵消关键事实错误。

要回答“哪个结果更适合我”,先定义自己的工作,再设计评分。一个与任务无关的总榜分数,不能告诉你这份材料是否被处理正确。

先写关键失败条件

以将活动材料整理成通知为例,可以把“编造活动日期”“漏掉必须报名”“泄露不应公开的联系人信息”设为关键失败。一旦出现,就先判本次结果不可采用,不能用文风优美的得分抵消。

这些条件应在阅读候选结果之前写好,否则容易在看过偏爱的答案后移动标准。一次失败也不证明某个模型永远不可用,它只说明本次结果不满足这个任务。

选择四个能说明工作量的维度

维度权重0 分3 分5 分
事实与材料一致40核心事实错有可修正遗漏本样本无事实性改动需求
格式与指令遵循20无法进入流程需手工整理符合指定格式
修改工作量20基本重写需要局部调整无实质修改
时间与成本适配20超过任务可接受范围勉强可接受符合预设范围

这是示范量表,不是通用行业标准。“事实一致”和“修改工作量”可能相关,使用时可以调整维度,避免反复奖励同一件事。时间与成本的分数需要先设定自己的可接受范围。

算一次完整例子

下面是人为设定的教学分数,不是任何模型的测试成绩:

A:5、4、3、2
B:3、4、5、2
A = (40×5 + 20×4 + 20×3 + 20×2) ÷ 100 = 3.8
B = (40×3 + 20×4 + 20×5 + 20×2) ÷ 100 = 3.4

在这组权重下 A 更高。如果你的工作更依赖修改速度,调高“修改工作量”的权重,结果可能变化。权重表达的是任务偏好,不是产品的固有能力。

高分却不能采用的情况

假设 A 的格式很好,但编造了一个报名截止日期。即使其他维度让平均分仍然很高,也必须触发先前设定的关键失败条件。比较器会保留分数供分析,同时提示不能仅按分数选取该结果。

让比较更可复现

  1. 保存同一份材料、同一提示词以及模型或工具的版本信息。
  2. 选取正常案例、边界案例与缺失信息案例,不只测最容易的一个问题。
  3. 先隐藏结果来自哪一方,再按预设规则评分,减少品牌偏好。
  4. 保留原始输出、修改记录和关键失败说明,不只保存最后的平均分。
  5. 有条件时由另一人独立打分;分歧本身能指出评分标准不清的地方。

少量任务和主观评分无法支持“全面最好”的结论。合适的结论是“在这组材料、条件与评分规则下,哪个结果更符合需求”。版本或材料发生变化后,应重新测试。

动手练习 · 原创教学样例

换一组权重,结论会变吗?

仍用 A=5、4、3、2,B=3、4、5、2,把权重改为 20、20、40、20。先手算,再用比较器核对。

完成后查看参考解析

A=(100+80+120+40)/100=3.4;B=(60+80+200+40)/100=3.8。排序反转是因为偏好变化,不是候选结果自己发生了变化;关键失败仍不能靠总分抵消。

检查要点

输入相同输出;只改权重;记录改变理由,而不是为偏好的候选事后调权。

下载本篇练习与解析(JSON) ↓

先尝试再对照。参考解析用于教学,不是实际产品测试记录。

下一步

用你的任务试一遍

把本文中的虚构材料替换成已获授权的任务材料,再按同样标准检查。

打开任务结果比较器 →

发现内容有误?提供原句和依据,帮助我们纠正