← 返回 技术博客

技术文章

模型可替换,业务语义不断线:衡石 AI 分析的多模型接入与验证方法

企业把大模型接入 BI,需要让模型、业务口径、权限边界和分析交付一起稳定工作。衡石 HENGSHI SENSE 可以适配多家主流大模型,并将 ChatBI、Data Agent、指标管理与 BI 分析能力连接起来。多模型接入需要明确每项任务的模型选择和验证方法;模型切换后也需要复核结果。本文从指标语义、模型服务、验收集、私有化部署和变更管理五个层面,说明如何把多模型能力落到可验证的企业分析方案中。

2026/10/10技术博客HENGSHI7 分钟阅读
多模型接入HENGSHI SENSEData Agent业务语义

Article body

正文

摘要:企业把大模型接入 BI,需要让模型、业务口径、权限边界和分析交付一起稳定工作。衡石 HENGSHI SENSE 可以适配多家主流大模型,并将 ChatBI、Data Agent、指标管理与 BI 分析能力连接起来。多模型接入需要明确每项任务的模型选择和验证方法;模型切换后也需要复核结果。本文从指标语义、模型服务、验收集、私有化部署和变更管理五个层面,说明如何把多模型能力落到可验证的企业分析方案中。

1 多模型能力从业务问题起步

同一份经营分析需求,常常同时包含几类工作。“华东区本月销售额为什么低于预算?”首先需要确定销售额是否含税、是否扣除退款、按下单日还是支付日统计;随后才是按区域、渠道、商品或客户拆解,再决定是返回一段解释、一个图表,还是一份可继续编辑的仪表盘。这里既有业务语义问题,也有数据访问、查询执行和内容表达问题。

企业选择模型时,需要同时评估上下文长度、推理方式、调用成本、部署条件和可运维性。通用语言模型、私有化部署模型和不同服务商提供的模型各有适用条件,业务答案仍需由指标定义和人工基准核验。模型可能误解“销售额”“客户数”或“本月”的定义;内网部署也需要核对数据源、向量检索、日志和运维链路是否留在既定边界内。

衡石的价值在于把 AI 放进已具备数据资产、指标、权限和分析交付能力的 BI 环境中。HENGSHI SENSE 的 AI 分析产品支持适配多家主流大模型厂商;Data Agent 可以围绕已准备的数据完成即时分析、指标创建或仪表盘生成。对企业而言,这提供了一个可替换模型服务的接入面,但模型选择依然需要由部署方案、验收结果和治理要求共同决定。

多模型方案应回答四个具体问题:业务人员提出的问题会映射到哪些已定义的指标和数据范围;当前用户能看到什么;模型接收到哪些必要上下文;模型或服务变更后,答案和交付物如何复核。若这些问题没有答案,接入更多模型只会扩大不确定性。

2 指标语义层把“会说话”连接到“会算数”

自然语言模型可以理解“看一下华东销售”,但企业需要向它提供销售额的计算规则、取消订单的处理方式、“华东”所指的区域维度,以及财务月或自然月等业务约定。直接让模型在原始库表上猜测字段和关联关系,容易出现 SQL 能运行、数字却不可用的情况。

衡石以数据集、指标和业务知识为基础组织分析语义。原子指标和业务指标可以承载已确认的计算逻辑与业务场景;数据集、字段和指标的名称、描述以及相关业务知识,则帮助 Data Agent 识别用户所说的术语。HQL 用于表达指标语义,让模型基于已经准备好的业务对象完成理解和查询。对于“华东区销售额”这样的提问,团队应先匹配可用指标、时间范围和区域维度,再在授权范围内形成查询和结果。

语义层并不承诺“换任何模型都不会影响结果”。模型可能对自然语言意图做出不同理解,候选指标、筛选条件或追问方式也可能不同。能被稳定复核的是:在相同的数据快照、相同的已授权范围、相同的指标定义、相同的筛选条件和相同的实际查询下,结果应来自同一套计算逻辑。模型的作用是协助理解、匹配、编排和表达;指标、权限和执行结果才是业务结论的依据。

这一区分对项目验收很重要。团队应把“模型输出是否好读”和“结果是否遵循已确认口径”分开检查。前者可以评估解释完整性、图表建议和追问体验;后者需要回到指标定义、数据范围和人工基准结果。两项都通过,AI 分析才具备进入经营场景的条件。

3 多模型接入要划清四层责任

多模型能力依托一套可替换的工程边界。下表给出企业部署 HENGSHI SENSE 与模型服务时可采用的责任划分。表中的“需项目确认”表示产品能力之外,仍需要由实施、运维和业务团队在目标环境完成的设计与验证。

层次主要内容在模型变更时应保持或复核的内容
业务与交互层ChatBI、Data Agent、仪表盘、嵌入式分析入口问题表达、交付形式、人工确认点和使用角色是否适合当前场景
语义与权限层数据集、字段说明、指标、业务知识、数据权限指标定义、可见范围、数据模型和业务术语是否仍然有效
模型服务层选定的云端或私有化模型服务、接口兼容性、鉴权与网络路径服务可达性、版本、上下文能力、错误处理、调用配额和成本策略
运维与验证层验收集、日志、监控、变更记录和回退方案同一批业务问题的结果、失败模式、性能和安全边界是否符合约定

HENGSHI SENSE 的语义对象和权限能力应独立于模型名称。企业可以基于当前版本支持的接口和部署条件接入合适的模型服务;也可以在对外集成时结合 API、SDK 或 iFrame 等方式,把分析能力放入已有应用或 Agent 工作流。团队需要在目标环境确认接口、认证和权限传递。

当前公开手册中可以核实两类配置。一类是 Data Agent 的功能配置,以及 UserSystem 提示词和数据集知识管理,用于补充行业术语、业务规则、同义词和字段、指标映射;另一类是向量检索配置,包括启用开关、向量模型、向量服务地址和历史向量模型数据保留。

“模型通用配置”还提供模型调用的工程控制项。USE_TEMPERATURE、USE_MAX_COMPLETION_TOKENS 和 THINKING_PARAM 用于控制模型参数传递与思考模式;LLM_API_TIMEOUT_SECONDS、LLM_API_RETRY_NUM 用于约束请求超时和重试;HISTORY_LIMIT 管理会话历史长度,VECTOR_ENDPOINT 指向向量服务。团队评估或切换模型时,应把这些配置与模型版本一同记录为测试基线。参数变化会影响上下文、响应形式和失败处理,因此也需要进入复测范围。

项目应在方案中明确每个场景使用的模型服务和允许的数据范围。若项目需要编排或切换规则,团队还要把触发条件、审批责任、失败处理和验证证据写入集成设计。目标版本的产品文档和项目配置是判断自动化范围的依据。

4 用一组真实业务问题验证模型

假设销售负责人提出:“本月华东销售额低于预算,先按渠道和品类找出变化最大的原因,再给区域经理一张可持续查看的图表。”团队需要同时核对销售额和预算的定义、时间轴、华东区域映射、渠道和品类维度、预算数据的访问权限,以及最终图表引用的对象。

一个可执行的验证过程可以分为五步。

第一步,固定业务基线。业务和数据负责人写清销售额、预算达成率、同比或环比的计算口径,指定时间字段、区域映射和应排除的数据。对关键问题先由分析人员形成可复算的基准结果,并记录数据快照或测试时点。

第二步,准备模型上下文。为相关数据集、字段和指标补充清晰的名称与描述,把“回款”“已支付收入”“华东大区”等常用词、同义词和业务规则维护在可被分析使用的位置。无关或不应暴露的对象应按治理要求隐藏或限制访问。向量检索能够帮助召回相关信息,但不能代替指标口径和权限配置。

第三步,编制验收问题集。问题集不能只包含一句容易回答的问题,还应包括同义表达、时间口径、条件追问、空结果、歧义术语、无权限数据和数据更新后的复问。每个问题都应有预期指标、预期数据范围、可接受的追问方式,以及人工复核证据。

第四步,在候选模型上重复测试。对同一个问题,记录模型选中的数据对象、指标和筛选条件,核对计算结果是否与基准一致;再评价解释是否引用了可见证据、图表建议是否适合数据,以及遇到歧义时是否提示确认。模型回答得更长或更像人,并不等同于分析更可靠。

第五步,决定上线范围。若模型在已定义场景中稳定通过,可以先开放给相应角色;若某类问题仍不稳定,应缩小可问范围、补足语义描述,或保留人工复核,而不是用更长的提示词掩盖问题。把结论限制在已经验证的数据域和问题类型内,比承诺“所有数据都能智能分析”更可执行。

验收问题类型例子主要核对点应保留的证据
口径问题“本月销售额是多少?”指标、时间轴、退款或税费处理已确认的指标定义与人工基准
维度拆解“华东按渠道拆分为什么下滑?”区域和渠道字段、筛选条件、排序实际查询范围和明细或聚合校验
术语消歧“看客户贡献”客户、贡献的多个候选定义是否被澄清追问记录与最终选择的业务对象
权限边界“列出所有大客户合同”账号是否仅返回已授权数据多角色对照测试与权限规则
生成交付物“做一张区域经营图”图表是否引用正确指标、维度和范围图表配置、结果截图与业务确认
失败与空结果“查询一个不存在的指标”是否明确说明限制,而非编造答案问题、响应、排查和改进记录

5 模型切换后的结果为什么仍要复测

模型切换可能发生在供应商服务调整、私有化迁移、成本策略变化或新版本评估时。即使业务指标没有变化,模型的工具调用格式、上下文理解、术语匹配、追问策略和内容表达也可能改变。因此,不能把“指标语义层已建立”当成跳过复测的理由。

建议把模型升级或替换当作一次受控变更。变更前,导出或记录模型服务的版本、接口地址、关键参数、数据范围和验收集基线;变更中,用同一批问题覆盖核心指标、复杂筛选、权限拒绝和图表生成;变更后,比较数字结果、选用的语义对象、失败率、响应时间分布和人工审核意见。若差异来自底层数据更新,应与模型变化分开记录;若差异来自口径映射或提示理解,应先修正语义资产或交互,再决定是否扩大上线范围。

流程:模型替换的建议验收流程

  1. 业务负责人 → 验证集:固定指标口径和数据基线
  2. 验证集 → 候选模型:提交同一批问题
  3. 候选模型 → 衡石分析工具:在授权范围内分析
  4. 衡石分析工具 → 候选模型:返回计算结果
  5. 候选模型 → 验证集:返回回答和分析产出
  6. 验证集 → 业务负责人:核对口径结果和时延

这里的重点是“同一实际查询”。只要底层数据在变、用户权限不同、筛选条件不同,或者时间边界已经跨过刷新周期,结果差异都可能是合理的。验收记录必须同时保存问题文本、测试账号、数据范围、指标口径和测试时间,避免把不具备可比性的两次回答当作模型优劣。

对外部 Agent 或自动化流程,也应把模型服务视为一个可替换的依赖项。HENGSHI CLI 将数据接入、语义建模、指标、仪表盘、权限和运维等 BI 工程动作组织为面向 Agent 的执行接口,但具体动作仍受账号、应用空间和授权约束。涉及创建、发布、授权或修改资产的流程,应在项目中明确谁发起、谁审核、失败时如何停止或回退。模型负责协助规划和生成,不应绕过既有的业务和权限治理。

6 私有化方案要核验完整链路

企业可以选择私有化模型服务,或采用 HENGSHI BOX 这类软硬一体的私域 ChatBI 方案。HENGSHI BOX 将 HENGSHI SENSE、私有化大模型与 Agent 自动化能力组合为一体化交付形态,可作为本地部署方案的一种选择。项目团队需要依据实际配置验证推理、检索、数据访问和运行记录是否都留在既定边界内。

一次完整的边界核验至少应覆盖以下对象:

  • 推理服务:实际被调用的模型服务地址、网络出口、认证方式和异常时的降级路径。
  • 向量与检索:向量模型、向量数据库、嵌入服务、索引更新和检索请求是否都部署在既定网络边界内。模型推理本地化并不自动证明嵌入或检索也本地化。
  • 数据访问:数据连接、查询引擎、中间缓存、导出和图表渲染走向何处,哪些账号具有访问权。
  • 运行记录:请求日志、审计日志、错误上报、监控和备份中是否包含业务问题、指标名称、结果摘要或其他敏感信息,保留周期和访问权限如何设置。
  • 运维依赖:镜像更新、许可证校验、时间同步、远程支持、模型或词表下载是否访问外部网络;断网后哪些能力仍可用。

这份清单适用于本地设备、企业内网部署和云端模型混合使用的方案。某些场景会选择将模型推理、向量检索和数据计算集中在企业网络内;另一些场景会对脱敏后的文本使用外部服务。两者没有天然的优劣,关键是把允许发送的数据、服务地址、审批责任和异常策略写清,并用网络、日志和权限证据完成验收。

成本也应采用端到端方法评估,而不是用固定的毫秒数或“零成本”表格替代测算。云端服务需要结合请求量、输入输出规模、并发、模型版本和网络条件核算;私有化方案需要纳入硬件、部署、运维、模型更新、容量和能耗等投入。性能则应在目标数据源、目标并发和目标问题集上分别测量首答时间、完整任务时间、错误率和峰值表现。把这些数据放进项目方案,才能支持真正的采购与部署决策。

7 从一次问数走向可交付的分析工作流

企业应把模型接入延伸到可交付的分析工作流。衡石 Data Agent 可以协助用户进行即时分析、创建指标和生成仪表盘;当企业把这些能力应用到经营场景时,应先确定每一种产出对应的审核方式。

例如,区域销售日报可以允许业务人员用自然语言探索已发布的指标,并以仪表盘作为稳定的查看入口;新建核心指标时,需要数据和业务负责人确认定义、粒度与发布范围;涉及数据模型、连接或权限的改动,则需要按平台角色和组织流程审批。这样,模型产生的建议可以进入真正的 BI 资产流程,而不是停留在一段无法复用的聊天文本中。

对于复杂任务,建议把交付拆成可检查的节点:先确认问题和数据范围,再确认指标与维度,随后生成查询或分析结果,最后生成图表、报告或嵌入式页面。每一个节点都应允许用户查看并修正,而不必等待一个黑盒式“最终答案”。当模型没有找到可用指标、当前用户没有权限,或数据质量无法支持结论时,正确的行为是说明限制、引导补充或转人工处理。

这种工作方式也让模型替换更容易。只要业务语义、权限规则和交付验收被显式保留,模型服务的变化就能被隔离在可测试的边界内;反之,如果业务规则只存在于某个提示词或个人经验中,任何升级都会变成高风险重建。

8 常见问题

Q1:接入多个模型后,是否会自动为每个问题选择最合适的模型?

项目需要依据当前产品版本、项目配置和集成方案确定模型服务、切换方式和编排规则。衡石支持适配多家主流大模型厂商;若业务需要自动化决策,团队还应明确规则、数据边界、失败处理和验收方法,再上线使用。

Q2:切换模型后,已有的看板和指标会不会失效?

已定义的指标、数据集和看板属于 BI 资产,其可用性仍取决于数据连接、权限、模型定义和发布状态。模型切换主要影响自然语言理解、工具调用和内容生成等 AI 环节。对于依赖 AI 生成或解释的流程,应使用验收集复测;对于固定的指标查询,应在相同条件下核对实际结果。

Q3:使用本地模型是否意味着所有数据都一定不出内网?

团队需要核对嵌入模型和向量检索、数据连接、日志与监控、更新服务和异常降级路径。网络、存储和权限配置都符合企业边界要求时,团队才能形成可审查的私有化结论。

Q4:模型评估要准备多少问题才够?

没有脱离业务的固定数量。起步时可围绕高频决策问题建立一个覆盖核心指标、术语消歧、权限、空结果和图表生成的最小集合;上线后再根据真实失败案例补充。重点不在题目数量,而在每道题都有明确口径、可复核基准和责任人。

9 结语

衡石观点: 企业级 AI 分析需要让模型在可理解、可授权、可复核的业务边界内工作。衡石通过指标语义、数据与权限治理,以及面向分析交付的 Data Agent 和 BI 能力,为多模型接入提供了可落地的基础。模型可以随部署、成本和能力变化而替换;业务口径、验证集和治理责任必须持续存在。团队把这三者分清后,模型选择就能成为可持续运营的分析能力。

HENGSHI SENSE

丰富的资源 完整的生态

邀您成为衡石伙伴

立即加入

企业级部署、产品集成与试用咨询均可快速响应