← 所有学习指南

选择方法 / 约 9 分钟

做一组小型验收测试:六个任务与逐字段解析

下载原创任务包,运行你自己的工具,再核对字段、类型与错误原因。

一个小型验收集的作用,是稳定发现你已经知道的失败类型。它不是能力排行榜,也不能证明工具适合所有任务。本页提供六个有明确答案的虚构任务,以及可以在本地运行的逐字段核对器。

这六个样例分别检查什么

编号任务主要检查点
event提取活动信息不猜缺失年份,保留报名要求
meeting提取会议决定不把未批准预算或未定日期变成承诺
product提取商品规格不从材料种类推断防水性能
order计算虚构订单件数、单价与总价一致
scope核对活动对象保留成年与本社区限制
translation从说明提取条件保留期限、否定和授权顺序

怎样实际运行

  1. 在配套工具下载任务包,里面只有任务、材料和字段要求,不包含参考答案。
  2. 把任务包交给你实际要使用的工具,要求只返回由六条对象组成的 JSON 数组,每条带对应 id。
  3. 保留原始输出、实际工具名称和版本、你运行的日期,以及是否做过人工修改。
  4. 把原始 JSON 粘贴到本站验收器。检查器不会替你调用任何模型。
  5. 查看逐字段差异,然后下载报告。报告中的“通过”仅表示本组预设字段匹配。

一条结果的形式

{"id":"order","quantity":2,"unit_price":15,"total":30}

这是参考答案的一条,不是某个模型的真实测试成绩。完整输出应包含六个任务;缺少任务、增加未知任务或重复 id 都会明确报出问题,不只对恰好答对的子集算分。

为什么采用严格匹配

本套题要求数字使用 JSON 数值,未知值使用 null,是否项使用 true 或 false。把 14 写成字符串“14”,即使人能理解,也不满足这里的类型约定。字段顺序不影响核验,多余字段则被标记,因为可能夹带任务没有授权的新结论。

这种检查适合结构化提取,不适合直接评价自由文本质量。一个用不同措辞表达同样意思的长答案,不能用本工具证明优劣。要评价文案风格或解释清晰度,请另设人工量表。

参考答案公开会有什么限制

你可以下载全部参考答案与理由来检查规则。公开答案使练习容易复现,但也意味着不能把这套题当成保密基准。如果把参考答案先交给模型,再让它输出,你测试的是复制能力,而不是独立完成任务的能力。

如何从练习走向自己的测试集

记录业务中真实发生、已获授权的错误类型,再为每一种错误准备代表样例。保留普通任务,也要包含缺失信息、条件句和边界情况。升级版本后使用同一组输入回归,新增发现的失败案例,但不要为了偏爱的结果事后修改答案。

读报告时应回答的三个问题

  • 失败是格式问题、字段类型问题,还是对材料理解错误?
  • 这些错误会不会影响实际交付,是否需要设为关键失败?
  • 这个练习集有没有覆盖我的真实任务,而不是只覆盖容易算分的内容?

六题全部通过不表示事实核查、隐私、图像能力或整体业务能力通过,也与 AdSense 审核无关。本站不发布虚构供应商排名;你提供的输出只在当前浏览器中核对。

动手练习 · 原创教学样例

格式正确但结果出错

将 order 参考项中的 total 改成 300,其他字段不动,提交六题结果。应该看到哪类失败?

完成后查看参考解析

order 的 total 数值不匹配,应看到期望 30、实际 300;另外五题仍可单独通过。把 quantity 改成字符串“2”也应失败,因为任务约定了数值类型。

检查要点

要使用完整六题;不要只提交正确的题;不要把字段失败数称为模型总体错误率。

下载本篇练习与解析(JSON) ↓

先尝试再对照。参考解析用于教学,不是实际产品测试记录。

下一步

用你的任务试一遍

把本文中的虚构材料替换成已获授权的任务材料,再按同样标准检查。

打开六题样例验收器 →

发现内容有误?提供原句和依据,帮助我们纠正