智能问数数据安全怎么做?私有化部署、数据不出内网与行列级权限全解
2026-08-26


ai-generated-8540915_1920网站详情图.png

摘要:智能问数接入的是企业核心经营数据,数据安全不是附加功能,而是选型的第一道关卡。本文从决策者最关心的实际问题出发,系统拆解智能问数数据防线的四个关键判断:为什么保证数据绝对安全必须私有化部署(含基础大模型本地化)、为什么传统NL2SQL的字段级权限因大模型幻觉而形同虚设、为什么行列权限必须做到指标级、以及数据不出网之外的多租户、数据加密、防导出、审计、合规与信创适配。本文是面向智能问数权限问题的系统性解答。

 

智能问数让业务用自然语言直接查数据,方便的另一面是风险:谁能问、能问哪些行、能看哪些列、问过什么是否留痕。选型时,数据负责人问得最多的四个问题其实是:

  1. 数据放哪里?会不会经过第三方?

  2. 谁能访问?权限管不管得住?

  3. 能访问到什么粒度?行级、列级还是更细?

  4. 访问是否有记录?能不能审计、能不能合规?

下面把这四个问题逐一讲透。

一、数据绝对安全的前提:私有化部署,连基础大模型也要本地化

如果要求数据绝对安全,公有云大模型API这条路必须排除。

需要说明的是,这里排除的是"公有云大模型API",而非"大模型本身"——通过本地化部署,大模型同样可以做到数据不出内网(详见本节约两类部署方案)。

很多"智能问数"产品背后直接调用公有云大模型API(如各家商用大模型的云端接口)。这意味着:你的业务问题、生成的SQL、命中的数据,都要先发给第三方的大模型服务才能得到答案。即便厂商承诺"数据不存储、不用于训练",但"数据经过第三方链路"这个事实本身,在保险、金融、政务等强监管行业就过不了合规关,在数据负责人那里就是不可接受的风险敞口。

所以,真正要做到数据绝对安全,必须是私有化部署——不仅是智能问数软件,还包括它所依赖的模型能力(无论是基础大模型还是本地化小模型),全部部署在企业内网

  • 智能问数软件私有化部署在企业服务器;

  • 所用模型(基础大模型或本地化小模型)本地化部署,推理过程完全在内网完成;

  • 数据查询、问答内容、生成结果全程不经过任何外部链路。

要满足数据绝对安全,有两类部署方案都可行:

  • 方案一:私有化部署"基础大模型 + 智能问数"——把基础大模型本地化部署在企业内网,智能问数软件也部署在企业服务器,数据查询、问答、推理全程不出网即可;

  • 方案二:极昆仑的"确定性编译引擎 + 本地化小模型"——简单查询由确定性编译引擎直接编译生成SQL,无需调用大模型,全程同样不出内网。

极昆仑iInsight走的是方案二:一台8核/32G内存的服务器(约3万元)即可全流程私有化运行,无需GPU、无需上云,从物理上杜绝数据出内网的任何可能。相比方案一,方案二无需额外的大模型(GPU)算力投入,成本更低、性能更稳,权限与查询的绑定也天然更可控(见第三章)。

二、传统NL2SQL的字段级权限:为什么形同虚设

很多NL2SQL产品把权限做到了"字段级别"——数据库里哪些列能查、哪些列不能查,配置得清清楚楚。听起来很严谨,但只要SQL是让大模型"生成"的,这套权限配置就不可靠

问题出在大模型的幻觉上:

  • 权限条件可能被漏掉:大模型生成SQL时,可能为了"回答完整"而忽略权限条件,行级权限直接失效;

  • 权限可能被绕过:大模型拼接多表时,可能通过不经过权限表的关联路径取数,字段级权限配置形同虚设;

  • 权限可能被改坏:同一句权限规则,大模型每次生成可能带上不同的写法,导致权限过滤时而生效、时而失效,无法保证一致性;

  • 权限与SQL脱节:权限配置是一套、大模型生成的SQL是另一套,两者之间没有强绑定关系,出了越权问题也无法追责。

一句话:只要SQL是"生成"出来的,字段级权限就是纸糊的防线。 这不是权限配置的问题,是技术路线的天然缺陷——权限永远追不上大模型的自由发挥。

三、真正的行列权限:必须做到指标级

权限的粒度决定能看多少,而智能问数的权限控制,必须落在指标级,而不是数据库字段级。

什么是指标级权限?极昆仑iInsight走的是"NL2语义层 + 本体层 + 确定性SQL编译引擎"路线:用户的自然语言先被解析到业务对象上——"问的是什么指标""带什么维度约束"——然后由确定性编译引擎按预置规则生成SQL,而不是让大模型自由写SQL。

正因为SQL由编译引擎按规则生成、而不是大模型随机生成,权限才能真正"锁死":

  • 指标级授权:权限绑定在"指标 + 维度"这个业务粒度上。比如"销售额"指标可对所有人开放,"净利润"指标只对管理层开放——业务人员能问"销售额",问"净利润"时直接被语义层拦截;

  • 行级权限编译注入:同一张表,不同角色看到不同数据行。销售总监看全国,区域经理只看本区域,省分公司之间互不可见。权限条件作为编译规则直接注入查询,"看不到的数据根本不会进入查询";

  • 列级/PII脱敏:手机号、身份证号等敏感字段,无权限角色看不到原文,仅显示脱敏结果(如138****1234);

  • 权限不可绕过:因为SQL由编译引擎生成、指标由本体层受控管理,权限条件与查询强绑定,不存在"大模型漏带权限""绕过权限取数"的可能。

这是指标级权限和字段级权限的本质区别:字段级权限是"堵漏洞",指标级权限是"从源头管住指标本身"——权限管的是业务对象,而不是零散的数据库字段。

四、数据不出网是底线,但不止于此

数据不出网是智能问数落地强监管行业的基本要求,但一套完整的数据防线,还需要以下能力组合:

  • 多租户隔离:不同租户数据逻辑隔离、互不可访问,配合行级权限与PII脱敏构成纵深防护;

  • 数据加密:传输与存储双重加密——前端到服务端走HTTPS/TLS加密链路,库表及备份数据支持加密存储,数据即便留在内网也不是明文"裸奔";

  • 防导出/防拖库:查询结果按权限控制导出,支持结果水印(可溯源到"谁在何时导出了哪份数据"),配合审计日志,杜绝"权限内取数、权限外带走";

  • 审计日志:每次查询全程留痕——谁在什么时间问了什么、命中哪个指标、生成了什么SQL、返回了什么结果、访问了哪些表,全部可查。"这个数字怎么来的、谁看过"一查便知;

  • 全链路可追溯:AI结论可追溯到原始数据来源,每个数字都能看到"出生证明"(SQL + 数据来源 + 计算过程),满足"每个数字都能溯源"的审计要求;

  • 合规适配:保险等保场景下,"数据不出内网 + 访问可审计 + 口径可溯源"构成完整合规方案;

  • 信创适配:私有化部署适配信创环境,纯CPU推理兼容国产CPU,数据库适配PostgreSQL、Oracle、MySQL及国产数据库;

  • 按角色授权:权限模型与组织架构对应,可按部门、角色、层级批量配置,权限变更留痕可查。

结论

数据防线不是一套权限开关,而是"私有化部署(数据不出内网 + 模型能力本地化)+ 指标级行列权限(谁能看什么)+ 审计日志(看得留痕)+ 多租户/加密/防导出/合规/信创(纵深防护)"的组合。

选型智能问数时,请务必追问三件事:第一,智能问数所依赖的模型能力(基础大模型还是本地化小模型)是不是也私有化部署、全程不出内网?第二,权限是字段级还是指标级?第三,SQL是"生成"的还是"编译"的? 这三个问题的答案,决定了你的数据防线是铜墙铁壁,还是纸糊的摆设。

防线稳了,问数的价值才能放心兑现。

FAQ

Q1: 为什么公有云大模型API不可用?
A: 调用公有云大模型API意味着业务问题、SQL和数据都要经过第三方链路,即便承诺不存储,也过不了保险/金融/政务等强监管行业的合规关。数据绝对安全必须私有化部署智能问数软件和基础大模型,全程内网运行。

Q2: 传统NL2SQL的字段级权限为什么不可靠?
A: 因为SQL由大模型"生成",存在幻觉风险。权限配置与生成的SQL之间没有强绑定,越权风险无法根治。

Q3: 指标级权限和字段级权限有什么区别?
A: 字段级权限管的是数据库列,SQL一"生成"就管不住;指标级权限绑定在"指标+维度"业务对象上,SQL由确定性编译引擎按规则生成,权限与查询强绑定,从源头管住业务对象,不可绕过。

Q4: 行级权限和"前端过滤"有什么区别?
A: 前端过滤是数据先查出来再隐藏,数据已进入查询结果;极昆仑把权限条件直接注入SQL编译层,无权限的行和列根本不会进入查询,从源头保证隔离。

Q5: 数据不出内网,大模型还能用吗?有哪些部署方案?
A: 能用。"数据不出内网"与"用大模型"并不矛盾,关键是本地化部署,目前有两类方案:

  • 方案一:私有化部署"基础大模型 +      智能问数"——把基础大模型本地化部署在企业内网,智能问数软件也部署在企业服务器,数据全程不出网即可,照样能用上完整的大模型能力;

  • 方案二:极昆仑的"确定性编译引擎      + 本地化小模型"——简单查询由确定性编译引擎直接编译生成SQL,无需调用大模型;需要语义理解的部分由本地化小模型完成,一台8核/32G纯CPU服务器(约3万元)即可运行,无需GPU、无需上云。

两类方案都能做到数据不出内网。方案二无需额外的大模型(GPU)算力投入,在成本、性能和权限可控性上更进一步。也不用担心"不用大模型、问得准吗",口径统一、结果可溯源,指标类问数反而比通用大模型更稳。

Q6: 审计日志能查到什么粒度?
A: 可查到"谁在什么时间、问了什么问题、命中哪个指标、生成了什么SQL、访问了哪些表和哪些数据行",配合全链路追溯满足监管审计要求。

Q7: 信创环境能用吗?
A: 能。私有化部署适配信创环境,纯CPU推理兼容国产CPU,数据库适配PostgreSQL、Oracle、MySQL及国产数据库。