评测使用指南
评测用于验证 Analytics Agent 在某个分析域中回答业务问题的效果。它解决的是“分析域上线前能不能稳定回答关键问题、配置调整后效果有没有变化、哪些问题需要优先治理”的问题。
你可以把一组高频、关键或曾经出错的问题保存为评测集,再选择评测规则、问答模型和裁判模型发起评测。评测完成后,系统会给出通过率、结果分布、问题原因和规则明细,帮助你发现 Bad Case,并在优化分析域后持续回归验证。
评测适合解决什么问题
| 场景 | 示例 | 评测的价值 |
|---|---|---|
| 上线前验收 | 新建“销售分析域”后,想确认高频销售问题能否稳定回答 | 用代表性问题集中验证分析域是否具备开放给业务用户的条件。 |
| 配置调整后回归 | 修改指标口径、字段语义、知识或答案构建器后,想确认历史问题是否仍然正常 | 用同一套评测集再次创建评测任务,再通过实验对比观察调整前后的结果差异。 |
| 定位准确性问题 | 回答取错指标、漏掉筛选条件、解释不完整或结论不可信 | 查看未通过和需复核 Case 的问题原因、规则明细和治理建议。 |
| 沉淀历史问题 | 真实对话中发现某个问题回答不符合预期 | 将问题加入评测集,后续每次优化后都可以回归验证。 |
评测集尤其适合包含以下类型的问题:
- 高频问题:业务人员每天或每周都会问的问题。
- 关键问题:影响经营判断、报表口径或管理决策的问题。
- 容易歧义的问题:涉及多个指标、时间范围、组织范围或业务术语的问题。
- 历史问题:曾经回答错误、需要人工核验或收到负反馈的问题。
核心概念
| 概念 | 说明 |
|---|---|
| 评测集 | 用于验证分析域效果的一组问题。每条数据包含用户问题,以及可选的期望输出。 |
| 评测规则 | 判断回答是否符合预期的标准,可以使用系统规则,也可以创建自定义规则。 |
| 评测任务 | 针对一个分析域,使用指定评测集、评测规则和模型执行的一次评测。 |
| 问答模型 | 创建评测任务时选择的模型,用于运行评测问题并生成 Agent 输出。 |
| 裁判模型 | 创建评测任务时选择的模型,用于按照评测规则输出结果判断和原因说明。 |
| 评测结果 | 每条评测数据的判断结果,包括通过、需复核、未通过。 |
| 实验对比 | 对比同一分析域、同一评测集下两次已完成评测任务的回答和结果差异。 |
一条完整的评测链路通常是:
准备评测集
评测集是一组固定问题。建议你先围绕一个分析域准备一套稳定的问题,再用这套问题反复验证分析域效果。
在“评测集列表”页面,你可以搜索评测集、查看数据量和导入状态,也可以新增、查看或删除评测集。

新增评测集
- 进入 Analytics Agent。
- 在左侧导航打开“效果评测”。
- 进入“评测集列表”页面。
- 点击“新增评测集”。
- 输入评测集名称和描述。
- 上传包含评测问题的 Excel 或 CSV 文件。
- 确认导入状态为成功。

上传文件至少需要包含“用户问题”列;“期望输出”为可选列,但建议填写。
| 用户问题 | 期望输出示例 |
|---|---|
| 2026 年 6 月华东区销售额是多少? | 给出销售额数值,并说明统计时间、区域和销售额口径。 |
| 哪个渠道的转化率最高? | 给出渠道名称、转化率和比较范围。 |
| 本月有效订单量相比上月变化如何? | 给出本月与上月的有效订单量、变化值或变化率,并说明有效订单定义。 |
“期望输出”不一定要写成完整答案,但应写清希望回答覆盖的关键事实、统计口径、时间范围、筛选条件和边界说明。
维护评测集数据
进入评测集详情后,你可以继续维护其中的问题:
- 手动添加:适合临时补充少量关键问题。
- 批量导入:继续上传 Excel 或 CSV,追加多条问题。
- 导出数据:下载现有问题,在本地集中维护后再导入。
建议不要频繁修改已经用于回归验证的核心问题。保持评测集稳定,才能更清楚地判断效果变化来自分析域配置,而不是来自测试问题变化。
从历史对话加入评测集
当你在真实对话中遇到一条典型问题时,可以直接从 Agent 回答下方将该问题加入评测集。这个入口适合沉淀 Good Case 和 Bad Case,降低评测集冷启动成本。
- 在分析域中完成一次对话。
- 在 Agent 回答下方点击“加入评测集”入口。
- 选择样例类型。
- 选择目标评测集,或新建评测集。
- 检查用户问题和期望输出。
- 点击保存。
| 样例类型 | 适用情况 | 期望输出默认值 |
|---|---|---|
| Good Case | 当前回答符合预期,值得作为标准样例沉淀 | 默认带入当前回答摘要,可继续编辑。 |
| Bad Case | 当前回答不符合预期,需要后续修复并回归验证 | 默认为空,建议补充正确回答方向。 |
Bad Case 不只是一次反馈。加入评测集后,后续每次优化分析域配置,都可以用同一问题重新验证,避免同类问题反复出现。
配置评测规则
评测规则决定裁判模型如何判断一个回答是否符合预期。你可以使用系统预置规则,也可以为特定业务场景创建自定义规则。
系统规则适合通用质量判断,例如:
- 回答是否正确。
- 指标口径是否一致。
- 解释是否可信,是否足以支持业务判断。
如果你的业务场景有明确要求,可以创建自定义规则。例如,销售分析域中的规则可以写为:
一条好的评测规则应清楚说明三类结果的判断标准:
| 结果 | 含义 |
|---|---|
| 通过 | 回答符合问题和期望输出,可直接用于业务判断。 |
| 需复核 | 回答方向基本正确,但口径、边界条件或解释不完整,需要人工确认。 |
| 未通过 | 关键指标、分析对象、时间范围、结论或事实明显错误,不能用于业务判断。 |
创建并运行评测任务
评测任务用于把评测集中的问题批量运行一遍,并按照你选择的规则生成判断结果。
- 进入“效果评测 > 评测任务”。
- 点击“创建评测任务”。
- 输入任务名称。
- 设置并行度。
- 选择问答模型。
- 选择裁判模型。
- 选择评测分析域。
- 选择评测数据。
- 选择一条或多条评测规则。
- 点击“创建评测任务”。

任务名称建议包含分析域、用途和日期,例如“销售分析域_上线验收_2026-07”。
并行度表示同一任务同时执行的 Case 数,当前支持填写 1–8。数字越大,执行速度通常越快;如果你希望降低模型调用压力,可以设置较小的并行度。
创建任务时,问答模型用于生成 Agent 回答;裁判模型用于按照评测规则判断回答结果。建议在同一轮回归验证中保持模型、评测集和规则一致,这样更容易判断分析域配置调整带来的影响。
任务创建后,会出现在“评测任务”列表中。你可以在列表中查看评测状态、进度、通过率、评测分析域、评测集、问答模型和裁判模型。

查看评测结果
评测完成后,点击任务名称进入结果页。结果页通常包含任务信息、结果概览和数据明细。
先看整体结果
结果概览用于判断本次评测的总体情况,重点关注:
- 通过率:最终结果为“通过”的 Case 数,占已完成 Case 总数的比例。
- 评测规模:本次共执行了多少条问题。
- 结果分布:通过、需复核、未通过分别有多少条。
当一条问题选择多条评测规则时,系统会按规则结果汇总最终结果:
| 规则结果组合 | Case 最终结果 |
|---|---|
| 任一规则为“未通过” | 未通过 |
| 没有“未通过”,但任一规则为“需复核” | 需复核 |
| 所有规则均为“通过” | 通过 |
查看 Bad Case 明细
在数据明细中,优先筛选“未通过”和“需复核”的 Case。你可以逐条查看:
- 用户问题和期望输出。
- Agent 输出。
- 最终结果判断。
- 问题原因。
- 规则级别的判断结果。
- 治理建议。
| 常见现象 | 可优先排查的方向 |
|---|---|
| 数值或指标错误 | 指标定义、底层数据、计算逻辑。 |
| 时间、区域、对象理解错误 | 字段语义、同义词、问题表达。 |
| 口径不一致 | 指标配置、知识、答案构建器。 |
| 回答缺少解释或边界 | 知识配置、规则标准、提示词与示例。 |

如果你确认自动判断与实际业务认知不一致,可以人工修改结果,并填写修改原因。系统会保留原始结果,便于后续追溯。
优化后再次创建评测任务
针对 Bad Case 完成分析域优化后,例如修正指标口径、补充字段语义、完善知识内容或调整答案构建器,建议使用相同的分析域、评测集、评测规则和模型再次创建一条评测任务。
- 回到“效果评测 > 评测任务”。
- 点击“创建评测任务”。
- 选择与上一次一致的分析域、评测集、评测规则、问答模型和裁判模型。
- 点击“创建评测任务”。
- 等待新任务完成后查看结果。
这样会形成一条新的评测任务记录,不会覆盖原有结果。后续可以通过“实验对比”查看两次任务在通过率、结果分布和 Case 明细上的差异。
对比两次评测
当你想判断一次优化是否带来变化时,可以使用“实验对比”。实验对比用于比较两次已完成评测任务的回答和结果差异。
可以参与对比的两个任务需要同时满足:
- 使用同一个分析域。
- 使用同一个评测集。
- 均已执行完成。
操作步骤:
- 进入“效果评测 > 评测任务”。
- 点击“实验对比”。
- 选择两个已完成任务。
- 点击确认进入对比页。
- 在“数据明细”中查看每个 Case 的两组回答和结果判断。
- 在“指标统计”中查看整体通过率、结果一致或不一致 Case 数,以及规则维度通过率。
建议先筛选“仅看结果不一致”,重点查看两次评测判断发生变化的问题。

常见问题
一条问题可以使用多条评测规则吗
可以。每条规则都会独立判断;任一规则为“未通过”时,该 Case 的最终结果即为“未通过”。
评测结果可以人工修改吗
可以。你可以将结果修改为“通过”“需复核”或“未通过”,并记录修改原因。系统会保留原始判断,便于审计和追溯。
为什么要填写期望输出
期望输出能帮助裁判模型理解“什么样的回答才符合业务预期”。对于关键指标、核心口径和容易歧义的问题,建议尽量填写期望输出。
为什么不能对比不同评测集的任务
不同评测集意味着测试问题不同,结果无法一一对应。为了让对比更有参考价值,实验对比应使用同一分析域、同一评测集下的已完成任务。
并行度应该设置多少
并行度当前支持 1–8。如果你希望任务尽快完成,可以在范围内设置较高并行度;如果你更关注稳定性或希望降低模型调用压力,可以设置较低并行度。建议先用较小评测集试跑,再根据任务规模调整。
