← 返回 技术博客

技术文章

Data Agent评估体系与基准测试:衡石分析智能体质量度量与回归测试技术框架

拆解衡石 Data Agent 如何通过准确性、效率、成本、安全四维评估,以及 Benchmark 和回归测试机制,让分析智能体可度量、可比较、可持续优化。

2026/08/25技术博客HENGSHI5 分钟阅读
Data AgentBenchmark回归测试Agent 评估HENGSHI
Data Agent评估体系与基准测试:衡石分析智能体质量度量与回归测试技术框架

Article body

正文

引言

「我们的 Data Agent 上线了」——这句话在企业里越来越常见。但紧接着的问题往往没人能答上来:它到底好不好?怎么衡量?和上月比进步了还是退步了?换了个模型是变强还是变弱了?

这是一个被严重低估的工程问题。大模型时代,BI Agent 的表现是概率性的、随模型版本波动的、随提示词微调漂移的。如果没有一套科学的评估体系,企业面对 Agent 就像「闭着眼睛开飞机」——能飞,但不知道飞得稳不稳、方向对不对。

衡石 Data Agent 构建了一套覆盖准确性、效率、成本、安全四维的评估框架,并配套可复用的基准测试集(Benchmark)和回归测试机制。 本文将拆解这套让 Agent「可被度量、可被比较、可被持续优化」的体系。


一、为什么 Agent 评估比传统软件难?

1.1 传统软件的评估范式失效

传统软件评估靠「断言」:输入 A,预期输出 B,不符即失败。结果是确定性的——要么对要么错。

Agent 的评估面对的是模糊空间

  • 同一个问题,Agent 可能用不同路径得到正确答案(路径不唯一)。
  • 「答案正确」本身需要定义——数字对、口径对、解读对,缺一不可。
  • 结果带有概率性,单次运行不能代表稳定水平,需要多次采样统计。

1.2 评估缺失的三类代价

  • 迭代盲目:模型升级、提示词调整后,你不知道是变好还是变坏,只能靠「体感」。
  • 选型无据:面对多个大模型(GPT-4、Claude、DeepSeek、本地模型),你不知道哪个在你的业务上更强。
  • 线上事故:没有回归测试,一次模型更新可能悄悄降低了某类问题的准确率,直到用户投诉才发现。

二、四维评估框架

衡石把 Data Agent 的评估拆为四个维度,每个维度有可量化指标:

2.1 准确性(Accuracy)——答得对不对

准确性是核心,进一步拆为:

  • 任务成功率(Task Success Rate):在基准测试集上,Agent 最终给出正确可用答案的比例。这是最关键的北极星指标。
  • 步骤准确率(Step Accuracy):在多步任务中,每一步的工具选择、参数生成是否正确。步骤准确率能更精细地定位问题出在哪一步。
  • 口径正确率:使用的指标定义、时间窗、过滤条件是否符合用户意图和业务规范。在金融等强口径场景,这项权重极高。
  • 幻觉率(Hallucination Rate):Agent 输出中无法从工具返回数据推导、或凭空编造的比例。目标值应趋近于零。

2.2 效率(Efficiency)——答得快不快

  • 平均完成步数:完成一个任务平均需要多少轮 ReAct 循环。步数过多说明规划或反思低效。
  • 端到端延迟:从提问到给出最终答案的总耗时,含 LLM 推理、工具执行、反思开销。
  • 首次响应时间:用户感知到的「它开始干活了」的延迟,影响体验。

2.3 成本(Cost)——答得贵不贵

  • 平均 Token 消耗:每次交互消耗的输入+输出 token。这是大模型调用的直接成本。
  • 工具调用成本:部分工具(如外部 API、计算资源)有自身成本,需纳入核算。
  • 成本/准确率比:单纯追求准确可能堆高成本,衡石关注「每单位成本换来的准确率提升」,指导模型选型和策略优化。

2.4 安全(Safety)——答得合规不合规

  • 权限越界率:Agent 是否尝试访问无权数据(应被沙箱拦截)。理想值为零越界且零漏拦。
  • 拒答恰当率:对于超出知识边界或高风险的问题,Agent 是否恰当拒答而非硬答。
  • 敏感信息泄露率:回答中是否意外暴露了其他用户/其他区域的数据。

三、基准测试集(Benchmark)的设计

3.1 测试集从哪来

衡石的基准测试集不是凭空编的,而是从真实业务中沉淀:

  • 历史 Trace 挖掘:从生产环境的匿名化 Trace 中,抽取高频、典型的问法和任务,作为测试样本。
  • 场景模板扩展:基于行业场景模板(金融/零售/制造),人工构造覆盖各子类型的测试用例。
  • 对抗样本:专门构造容易出错的「陷阱题」(歧义问法、长尾维度、跨源口径冲突),压力测试 Agent 的鲁棒性。

3.2 测试集的分层结构

测试集按难度和类型分层,便于定位能力短板:

  • L1 单步查询:一句话直接得出结果(如「昨日总销售额」)。考察基础理解和执行。
  • L2 多步分析:需规划多步(如「华东 top 5 产品及其同比」)。考察规划和工具编排。
  • L3 复杂推理:涉及归因、对比、假设验证(如「良率下降的原因」)。考察反思和验证能力。
  • L4 对抗鲁棒:歧义、省略、陷阱。考察消歧和拒答边界。

3.3 标注与评分标准

每个测试用例配有「标准答案」和「评分 rubric」:

  • 标准答案包含正确的指标、维度、口径、预期结论。
  • 评分 rubric 定义「完全正确 / 部分正确 / 错误」的判定细则,例如口径偏差但数字对的,判为「部分正确」并扣分,而非一刀切判错。

四、回归测试:让每次变更都可被验证

4.1 为什么需要回归测试

Data Agent 的组成部分(模型版本、提示词、语义层、工具集)任何一处变动,都可能影响整体表现。回归测试确保「改了一处,不会悄悄弄坏另一处」。

4.2 回归测试流程

衡石把回归测试嵌入 Agent 的迭代流程:

  1. 变更触发:当模型升级、提示词调整、语义层更新时,自动触发回归测试。
  2. 全量跑批:在基准测试集上重跑 Agent,收集四维指标。
  3. 差异对比:与上一版基线对比,生成「准确率 +2.1%、延迟 -8%、成本 +5%、幻觉率 0%」这类差异报告。
  4. 门禁判定:设定质量门禁(如任务成功率不得低于基线 1%、幻觉率不得上升)。不达标则阻断发布,回到优化环节。

4.3 与 CI/CD 的衔接

在之前 CLI 的 CI/CD 文章中我们介绍过,衡石的 BI 开发可以流水线化。Agent 的回归测试同样接入流水线——每次提示词或语义层提交的 MR(合并请求),都会自动跑回归测试套件,把质量保障左移到开发阶段,而非等到上线后由用户发现。


五、在线评估:生产环境的持续度量

5.1 离线评估的局限

基准测试是离线的、受控的,但真实用户的问题千变万化、超出测试集覆盖。离线高分不代表线上无忧。

5.2 在线评估信号

衡石在生产环境采集三类在线信号,作为离线评估的补充:

  • 显式反馈:用户对回答的「赞/踩」、修正行为(「不对,我是说……」)。踩和修正是强信号,直接计入质量度量。
  • 隐式信号:用户是否就同一问题反复追问(可能首答不佳)、是否在拿到答案后继续深入(可能首答可用)。
  • 异常拦截率:沙箱拦截的越权尝试次数,反映线上安全水位。

5.3 反馈闭环到优化

在线信号会回流到基准测试集——用户踩过的高频问题,被提炼为标准测试用例,防止同类错误复发。这形成了「线上发现问题 → 离线沉淀用例 → 迭代优化 → 回归验证 → 上线」的持续进化闭环。


六、模型选型的量化依据

6.1 不再是「听别人说哪个强」

有了评估框架,模型选型变成可量化的对比实验:

  • 在同一基准测试集上,分别跑 GPT-4、Claude、DeepSeek、本地模型。
  • 对比四维指标,绘制「准确率-成本」散点图。
  • 结合业务诉求(重准确还是重成本、数据是否允许出域)做决策。

实践中常出现「某个模型在通用基准强,但在你的金融口径任务上弱」的情况——这正是评估的价值:在你的业务上测,而不是在别人的榜单上看。

6.2 混合路由的依据

衡石支持多模型路由(简单任务用便宜模型、复杂任务用强模型)。路由策略的边界怎么划?评估框架给出答案:用测试集测出「各模型在 L1-L4 各层的准确率和成本交叉点」,把路由规则建立在数据而非拍脑袋上。


七、评估的落地建议

7.1 从小测试集开始

不必一开始就建庞大的 Benchmark。从 50-100 个真实高频问题起步,先跑通「评估—对比—回归」的闭环,再随业务扩展测试集规模。

7.2 指标要分层看

不要只看任务成功率一个指标。一个「成功率高但幻觉率也高」的 Agent 比「成功率略低但零幻觉」的更危险。四维指标要一起看,且根据行业调整权重(金融重口径、零售重效率)。

7.3 评估本身也要成本可控

每次全量回归都要消耗 LLM 调用。衡石采用分层采样——日常迭代跑 L1-L2 子集快速反馈,重大版本才跑全量 L1-L4。在反馈速度和成本间平衡。


八、技术对比

维度无评估人工抽查系统化评估(衡石)
准确率度量凭体感抽样主观基准集量化
变更影响未知事后发现回归门禁阻断
模型选型听传闻试错数据驱动对比
持续优化随机被动反馈闭环驱动

九、FAQ

Q1:建一套基准测试集要花多少精力?

起步成本低。从真实 Trace 抽 50-100 个高频问题并标注标准答案,半天到一天即可。关键是「先有闭环」,再随业务滚动扩充。

Q2:评估结果能直接用于对外宣传吗?

可以,且建议用真实评测数据说话。衡石的评估框架产出的四维指标,本身就是产品能力的客观背书,比「我们很智能」这类空话有说服力得多。

Q3:小团队也需要这么重的评估体系吗?

评估的「重」是相对的。小团队可以用轻量版——一个测试集 + 一次对比 + 人工看差异,就能避开「闭眼开飞机」的风险。体系的价值在于「有」,不在于「全」。


十、总结

Data Agent 的上线不是终点,而是「可度量、可优化、可证明」的起点。衡石通过四维评估框架 + 分层基准测试集 + 回归测试门禁 + 在线反馈闭环,把 Agent 的质量从「玄学」变成「工程」。

核心认知是:不能度量,就无法优化;不能回归,就无法迭代;不能证明,就无法取信。 当企业能用一套客观指标回答「我的 Agent 到底好不好、和上个月比是强了还是弱了」,Data Agent 才真正成为一个可管理、可负责的数字化资产。

至此,我们用六篇文章,从 ChatBI 的「听得懂、聊得顺、信得过」,到 Data Agent 的「会纠错、能落地、可度量」,完整勾勒了衡石在 AI 驱动分析两条主线的技术全景。这既是 55 篇衡石技术文章的延续,也是新一代智能分析能力的最新注脚。

HENGSHI SENSE

丰富的资源 完整的生态

邀您成为衡石伙伴

立即加入

企业级部署、产品集成与试用咨询均可快速响应