评测使用指南

评测用于验证 Analytics Agent 在某个分析域中回答业务问题的效果。它解决的是“分析域上线前能不能稳定回答关键问题、配置调整后效果有没有变化、哪些问题需要优先治理”的问题。

你可以把一组高频、关键或曾经出错的问题保存为评测集,再选择评测规则、问答模型和裁判模型发起评测。评测完成后,系统会给出通过率、结果分布、问题原因和规则明细,帮助你发现 Bad Case,并在优化分析域后持续回归验证。

评测适合解决什么问题

场景示例评测的价值
上线前验收新建“销售分析域”后,想确认高频销售问题能否稳定回答用代表性问题集中验证分析域是否具备开放给业务用户的条件。
配置调整后回归修改指标口径、字段语义、知识或答案构建器后,想确认历史问题是否仍然正常用同一套评测集再次创建评测任务,再通过实验对比观察调整前后的结果差异。
定位准确性问题回答取错指标、漏掉筛选条件、解释不完整或结论不可信查看未通过和需复核 Case 的问题原因、规则明细和治理建议。
沉淀历史问题真实对话中发现某个问题回答不符合预期将问题加入评测集,后续每次优化后都可以回归验证。

评测集尤其适合包含以下类型的问题:

  • 高频问题:业务人员每天或每周都会问的问题。
  • 关键问题:影响经营判断、报表口径或管理决策的问题。
  • 容易歧义的问题:涉及多个指标、时间范围、组织范围或业务术语的问题。
  • 历史问题:曾经回答错误、需要人工核验或收到负反馈的问题。

核心概念

概念说明
评测集用于验证分析域效果的一组问题。每条数据包含用户问题,以及可选的期望输出。
评测规则判断回答是否符合预期的标准,可以使用系统规则,也可以创建自定义规则。
评测任务针对一个分析域,使用指定评测集、评测规则和模型执行的一次评测。
问答模型创建评测任务时选择的模型,用于运行评测问题并生成 Agent 输出。
裁判模型创建评测任务时选择的模型,用于按照评测规则输出结果判断和原因说明。
评测结果每条评测数据的判断结果,包括通过、需复核、未通过。
实验对比对比同一分析域、同一评测集下两次已完成评测任务的回答和结果差异。

一条完整的评测链路通常是:

准备问题 → 创建评测集 → 配置评测规则 → 创建评测任务 → 查看 Bad Case → 优化分析域 → 再次创建任务 → 实验对比

准备评测集

评测集是一组固定问题。建议你先围绕一个分析域准备一套稳定的问题,再用这套问题反复验证分析域效果。

在“评测集列表”页面,你可以搜索评测集、查看数据量和导入状态,也可以新增、查看或删除评测集。

新增评测集

  1. 进入 Analytics Agent。
  2. 在左侧导航打开“效果评测”。
  3. 进入“评测集列表”页面。
  4. 点击“新增评测集”。
  5. 输入评测集名称和描述。
  6. 上传包含评测问题的 Excel 或 CSV 文件。
  7. 确认导入状态为成功。

上传文件至少需要包含“用户问题”列;“期望输出”为可选列,但建议填写。

用户问题期望输出示例
2026 年 6 月华东区销售额是多少?给出销售额数值,并说明统计时间、区域和销售额口径。
哪个渠道的转化率最高?给出渠道名称、转化率和比较范围。
本月有效订单量相比上月变化如何?给出本月与上月的有效订单量、变化值或变化率,并说明有效订单定义。

“期望输出”不一定要写成完整答案,但应写清希望回答覆盖的关键事实、统计口径、时间范围、筛选条件和边界说明。

维护评测集数据

进入评测集详情后,你可以继续维护其中的问题:

  • 手动添加:适合临时补充少量关键问题。
  • 批量导入:继续上传 Excel 或 CSV,追加多条问题。
  • 导出数据:下载现有问题,在本地集中维护后再导入。

建议不要频繁修改已经用于回归验证的核心问题。保持评测集稳定,才能更清楚地判断效果变化来自分析域配置,而不是来自测试问题变化。

从历史对话加入评测集

当你在真实对话中遇到一条典型问题时,可以直接从 Agent 回答下方将该问题加入评测集。这个入口适合沉淀 Good Case 和 Bad Case,降低评测集冷启动成本。

  1. 在分析域中完成一次对话。
  2. 在 Agent 回答下方点击“加入评测集”入口。
  3. 选择样例类型。
  4. 选择目标评测集,或新建评测集。
  5. 检查用户问题和期望输出。
  6. 点击保存。
样例类型适用情况期望输出默认值
Good Case当前回答符合预期,值得作为标准样例沉淀默认带入当前回答摘要,可继续编辑。
Bad Case当前回答不符合预期,需要后续修复并回归验证默认为空,建议补充正确回答方向。

Bad Case 不只是一次反馈。加入评测集后,后续每次优化分析域配置,都可以用同一问题重新验证,避免同类问题反复出现。

配置评测规则

评测规则决定裁判模型如何判断一个回答是否符合预期。你可以使用系统预置规则,也可以为特定业务场景创建自定义规则。

系统规则适合通用质量判断,例如:

  • 回答是否正确。
  • 指标口径是否一致。
  • 解释是否可信,是否足以支持业务判断。

如果你的业务场景有明确要求,可以创建自定义规则。例如,销售分析域中的规则可以写为:

回答必须使用“已支付订单金额”作为销售额;需要明确时间范围与区域范围;如果无法确认口径或筛选条件,结果应为“需复核”。

一条好的评测规则应清楚说明三类结果的判断标准:

结果含义
通过回答符合问题和期望输出,可直接用于业务判断。
需复核回答方向基本正确,但口径、边界条件或解释不完整,需要人工确认。
未通过关键指标、分析对象、时间范围、结论或事实明显错误,不能用于业务判断。

创建并运行评测任务

评测任务用于把评测集中的问题批量运行一遍,并按照你选择的规则生成判断结果。

  1. 进入“效果评测 > 评测任务”。
  2. 点击“创建评测任务”。
  3. 输入任务名称。
  4. 设置并行度。
  5. 选择问答模型。
  6. 选择裁判模型。
  7. 选择评测分析域。
  8. 选择评测数据。
  9. 选择一条或多条评测规则。
  10. 点击“创建评测任务”。

任务名称建议包含分析域、用途和日期,例如“销售分析域_上线验收_2026-07”。

并行度表示同一任务同时执行的 Case 数,当前支持填写 1–8。数字越大,执行速度通常越快;如果你希望降低模型调用压力,可以设置较小的并行度。

创建任务时,问答模型用于生成 Agent 回答;裁判模型用于按照评测规则判断回答结果。建议在同一轮回归验证中保持模型、评测集和规则一致,这样更容易判断分析域配置调整带来的影响。

任务创建后,会出现在“评测任务”列表中。你可以在列表中查看评测状态、进度、通过率、评测分析域、评测集、问答模型和裁判模型。

查看评测结果

评测完成后,点击任务名称进入结果页。结果页通常包含任务信息、结果概览和数据明细。

先看整体结果

结果概览用于判断本次评测的总体情况,重点关注:

  • 通过率:最终结果为“通过”的 Case 数,占已完成 Case 总数的比例。
  • 评测规模:本次共执行了多少条问题。
  • 结果分布:通过、需复核、未通过分别有多少条。

当一条问题选择多条评测规则时,系统会按规则结果汇总最终结果:

规则结果组合Case 最终结果
任一规则为“未通过”未通过
没有“未通过”,但任一规则为“需复核”需复核
所有规则均为“通过”通过

查看 Bad Case 明细

在数据明细中,优先筛选“未通过”和“需复核”的 Case。你可以逐条查看:

  • 用户问题和期望输出。
  • Agent 输出。
  • 最终结果判断。
  • 问题原因。
  • 规则级别的判断结果。
  • 治理建议。
常见现象可优先排查的方向
数值或指标错误指标定义、底层数据、计算逻辑。
时间、区域、对象理解错误字段语义、同义词、问题表达。
口径不一致指标配置、知识、答案构建器。
回答缺少解释或边界知识配置、规则标准、提示词与示例。

如果你确认自动判断与实际业务认知不一致,可以人工修改结果,并填写修改原因。系统会保留原始结果,便于后续追溯。

优化后再次创建评测任务

针对 Bad Case 完成分析域优化后,例如修正指标口径、补充字段语义、完善知识内容或调整答案构建器,建议使用相同的分析域、评测集、评测规则和模型再次创建一条评测任务。

  1. 回到“效果评测 > 评测任务”。
  2. 点击“创建评测任务”。
  3. 选择与上一次一致的分析域、评测集、评测规则、问答模型和裁判模型。
  4. 点击“创建评测任务”。
  5. 等待新任务完成后查看结果。

这样会形成一条新的评测任务记录,不会覆盖原有结果。后续可以通过“实验对比”查看两次任务在通过率、结果分布和 Case 明细上的差异。

对比两次评测

当你想判断一次优化是否带来变化时,可以使用“实验对比”。实验对比用于比较两次已完成评测任务的回答和结果差异。

可以参与对比的两个任务需要同时满足:

  • 使用同一个分析域。
  • 使用同一个评测集。
  • 均已执行完成。

操作步骤:

  1. 进入“效果评测 > 评测任务”。
  2. 点击“实验对比”。
  3. 选择两个已完成任务。
  4. 点击确认进入对比页。
  5. 在“数据明细”中查看每个 Case 的两组回答和结果判断。
  6. 在“指标统计”中查看整体通过率、结果一致或不一致 Case 数,以及规则维度通过率。

建议先筛选“仅看结果不一致”,重点查看两次评测判断发生变化的问题。

常见问题

一条问题可以使用多条评测规则吗

可以。每条规则都会独立判断;任一规则为“未通过”时,该 Case 的最终结果即为“未通过”。

评测结果可以人工修改吗

可以。你可以将结果修改为“通过”“需复核”或“未通过”,并记录修改原因。系统会保留原始判断,便于审计和追溯。

为什么要填写期望输出

期望输出能帮助裁判模型理解“什么样的回答才符合业务预期”。对于关键指标、核心口径和容易歧义的问题,建议尽量填写期望输出。

为什么不能对比不同评测集的任务

不同评测集意味着测试问题不同,结果无法一一对应。为了让对比更有参考价值,实验对比应使用同一分析域、同一评测集下的已完成任务。

并行度应该设置多少

并行度当前支持 1–8。如果你希望任务尽快完成,可以在范围内设置较高并行度;如果你更关注稳定性或希望降低模型调用压力,可以设置较低并行度。建议先用较小评测集试跑,再根据任务规模调整。

相关文档

联系我们
预约咨询
微信咨询
电话咨询
邮件咨询