一个小型验收集的作用,是稳定发现你已经知道的失败类型。它不是能力排行榜,也不能证明工具适合所有任务。本页提供六个有明确答案的虚构任务,以及可以在本地运行的逐字段核对器。
这六个样例分别检查什么
| 编号 | 任务 | 主要检查点 |
|---|---|---|
| event | 提取活动信息 | 不猜缺失年份,保留报名要求 |
| meeting | 提取会议决定 | 不把未批准预算或未定日期变成承诺 |
| product | 提取商品规格 | 不从材料种类推断防水性能 |
| order | 计算虚构订单 | 件数、单价与总价一致 |
| scope | 核对活动对象 | 保留成年与本社区限制 |
| translation | 从说明提取条件 | 保留期限、否定和授权顺序 |
怎样实际运行
- 在配套工具下载任务包,里面只有任务、材料和字段要求,不包含参考答案。
- 把任务包交给你实际要使用的工具,要求只返回由六条对象组成的 JSON 数组,每条带对应 id。
- 保留原始输出、实际工具名称和版本、你运行的日期,以及是否做过人工修改。
- 把原始 JSON 粘贴到本站验收器。检查器不会替你调用任何模型。
- 查看逐字段差异,然后下载报告。报告中的“通过”仅表示本组预设字段匹配。
一条结果的形式
{"id":"order","quantity":2,"unit_price":15,"total":30}
这是参考答案的一条,不是某个模型的真实测试成绩。完整输出应包含六个任务;缺少任务、增加未知任务或重复 id 都会明确报出问题,不只对恰好答对的子集算分。
为什么采用严格匹配
本套题要求数字使用 JSON 数值,未知值使用 null,是否项使用 true 或 false。把 14 写成字符串“14”,即使人能理解,也不满足这里的类型约定。字段顺序不影响核验,多余字段则被标记,因为可能夹带任务没有授权的新结论。
这种检查适合结构化提取,不适合直接评价自由文本质量。一个用不同措辞表达同样意思的长答案,不能用本工具证明优劣。要评价文案风格或解释清晰度,请另设人工量表。
参考答案公开会有什么限制
你可以下载全部参考答案与理由来检查规则。公开答案使练习容易复现,但也意味着不能把这套题当成保密基准。如果把参考答案先交给模型,再让它输出,你测试的是复制能力,而不是独立完成任务的能力。
如何从练习走向自己的测试集
记录业务中真实发生、已获授权的错误类型,再为每一种错误准备代表样例。保留普通任务,也要包含缺失信息、条件句和边界情况。升级版本后使用同一组输入回归,新增发现的失败案例,但不要为了偏爱的结果事后修改答案。
读报告时应回答的三个问题
- 失败是格式问题、字段类型问题,还是对材料理解错误?
- 这些错误会不会影响实际交付,是否需要设为关键失败?
- 这个练习集有没有覆盖我的真实任务,而不是只覆盖容易算分的内容?
六题全部通过不表示事实核查、隐私、图像能力或整体业务能力通过,也与 AdSense 审核无关。本站不发布虚构供应商排名;你提供的输出只在当前浏览器中核对。
动手练习 · 原创教学样例
格式正确但结果出错
将 order 参考项中的 total 改成 300,其他字段不动,提交六题结果。应该看到哪类失败?
完成后查看参考解析
order 的 total 数值不匹配,应看到期望 30、实际 300;另外五题仍可单独通过。把 quantity 改成字符串“2”也应失败,因为任务约定了数值类型。
检查要点
要使用完整六题;不要只提交正确的题;不要把字段失败数称为模型总体错误率。
先尝试再对照。参考解析用于教学,不是实际产品测试记录。
发现内容有误?提供原句和依据,帮助我们纠正。