Article body
正文
自然语言问数降低了数据使用门槛,也要求企业重新核对数据访问边界。本文以衡石公开产品资料为依据,说明身份与连接权限、应用数据权限模式、行列权限和公开链接等控制面,并给出 Data Agent 场景下的配置与 POC 验证要点。
1 老围栏为什么失效
传统 BI 常以报表、目录和应用访问为入口;而自然语言问数会减少用户对既有导航路径的依赖。因此,不能只依靠报表可见性判断数据边界,仍需让身份、连接权限、应用数据权限和数据集的行列权限共同生效。
在 AI 问数场景中,应重点核查行列权限是否按预期生效、应用数据权限模式是否与数据分发目标一致、公开链接是否被误用,以及派生数据集与导出路径是否被覆盖。提示词和业务规则可帮助提升回答质量,但不应被视为独立的权限边界。
2 从资产访问到可验证的数据权限控制
2.1 常见基础:资源与应用访问控制
资源与应用访问控制仍是基础:它决定谁可进入某个应用或查看特定资源。但对涉及多数据源、细粒度数据分发和自然语言分析的场景,访问应用本身不能替代对连接、表及数据范围的权限管理。
2.2 语义与数据管理:提高可理解性,不替代权限
统一的字段、指标描述和业务口径有助于降低理解偏差。衡石 Data Agent 支持通过提示词、知识管理、数据向量化和数据准备改善分析质量;这些配置影响模型的理解与输出,不等同于访问授权,也不能替代连接、应用和数据集权限。
2.3 权限基线:身份、连接与应用数据权限
衡石公开资料说明,Data Agent 会在用户有权限的数据范围内检索和分析。实际边界取决于身份、连接权限、应用数据权限模式、行列权限以及公开链接配置等组合;这些控制应按具体部署版本和配置进行验证。不要将提示词、展示层脱敏或单一查询规则视为覆盖所有访问路径的安全机制。
表 1 AI 问数场景的安全控制面与验证重点
| 安全控制面 | 公开资料所述能力 | 关键边界 | 验证建议 |
|---|---|---|---|
| 身份与连接权限 | 连接、目录、表可按 LS、SC、RO、RW 授权;表支持行列权限,并可结合用户属性过滤。 | 实际可访问范围取决于角色、连接授权与数据集配置的组合。 | 使用不同角色和用户属性的测试账号,核对连接、表、行和列的结果。 |
| 应用数据权限 | 应用有应用作者、数据集作者、使用者三种数据权限模式;前两种模式可在应用内配置行列权限。 | 使用者模式下,应用内行权限不生效,按当前用户的连接权限访问数据。 | 逐一验证三种模式,以及应用内规则与连接权限的实际效果。 |
| Data Agent | Data Agent 在用户有权限的数据范围内检索和分析;提示词、知识管理、向量化和数据准备可影响回答质量。 | AI 输出具有不确定性;提示词和调优配置不是独立的访问控制。 | 用允许与禁止的真实问题、不同用户身份和异常输入完成 POC 验证。 |
| 公开链接与展示 | 公开链接为匿名访问,不受应用行权限限制;使用者模式不支持公开链接。表格信息脱敏属于图表展示层配置。 | 公开链接、明细查看、导出、钻取及展示层脱敏需要分别核查,不能相互替代。 | 以匿名访问和授权访问分别测试公开链接、明细、导出和钻取路径。 |
| 审计与运营 | 系统操作记录可按时间、操作者、IP、行为、结果、类别、对象和描述查询,并可筛选导出数据操作。 | 公开资料未说明其记录每次问数的完整问题、返回内容或与其他智能体追踪信息的贯通情况。 | 在目标版本和部署环境中核验日志范围、保留策略与导出审计需求。 |
3 面向 AI 问数的可落地安全控制面
3.1 访问边界:连接、应用与行列权限
连接、目录和表权限,以及表级行列权限,是数据访问控制的重要基础;可结合用户属性等条件实现数据分发。应用还需明确选择应用作者、数据集作者或使用者模式。需要特别注意:上游数据集的行权限不会自动传递到下游派生数据集,派生数据集须单独设置并验证权限。图表表格的信息脱敏属于展示层配置,应与明细、钻取、导出等访问路径分别核验。
3.2 分析质量与权限控制分别管理
Data Agent 可基于提示词、知识管理、向量化和数据准备理解业务语义,并在用户有权限的数据范围内检索和分析。上述调优项用于改善回答相关性和一致性,不应承担权限边界的职责。对于包含异常或诱导性表述的输入,应通过不同身份和真实数据范围的 POC 检验,确认其不会改变既有权限配置。
3.3 交付、公开链接与审计
公开链接属于匿名访问,不受应用行权限限制;使用者模式不支持公开链接。对于公开链接,文档提供明细查看和导出等交互配置,默认不允许查看明细数据和导出数据,但上线前仍应在目标版本中复核。系统操作记录可按时间、操作者、IP、行为、结果、类别、对象和描述查询,并可筛选导出数据操作;其具体保留范围、是否覆盖问数内容及告警能力,应以实际部署配置和验收结果为准。
4 安全管理应以可解释配置和 POC 验证为准
良好的安全体验不是以放宽边界换取“能答”,而是让业务目标、可访问的数据范围和申请权限路径保持清晰。不同版本、模型与配置下的回答或提示方式可能不同,因此应将允许、部分可见、不可访问等目标行为写入 POC 验收用例,而不预设某种固定的产品交互机制。
权限配置应有回归测试:为不同角色、用户属性、应用权限模式、公开链接和派生数据集准备“应允许”“应拒绝”“应仅见部分数据”的测试用例。配置或数据模型变更后重新执行这些用例,可及早发现数据范围被意外放大的问题。
5 对企业 AI+BI 安全建设的启示
第一,以身份、角色、连接权限、应用数据权限模式及数据集行列权限构成最小权限基线,并按实际数据分发场景选择配置。第二,将公开链接、使用者模式、派生数据集和展示层脱敏视为独立边界,分别管理与验证。第三,数据准备和提示词有助于提升 Data Agent 的分析质量,但 AI 输出具有不确定性;上线前应通过真实用户、真实数据范围和允许/拒绝用例完成 POC 验证。
6 结语:安全边界需在实际配置中验证
AI 问数的推广不应以牺牲数据边界为代价。衡石的公开能力为企业提供了身份、连接、应用数据权限、行列权限、公开链接与审计等控制面;具体效果仍取决于版本、部署与配置。将这些边界纳入 POC 和上线后的持续回归,才能在扩大数据使用范围的同时保持可验证的数据安全。