2026下半年智能问数选型指南:从AI能问数到AI能干活
2026-08-10

官网顶部大图.jpg

摘要:智能问数(也称 ChatBI、ABI 智能问数、Data Agent、NL2SQL 问数、对话式 BI)是企服领域最热的赛道之一。2026年上半年,这个赛道完成了从"能不能用"到"准不准"的市场验证。下半年,竞争焦点正在从"准确率"转向"协作深度"——智能问数不再只是一个问答工具,而是升级为能主动推理、能嵌入工作流的数据搭档。本文提出新一代智能问数成熟度评估框架,从推理能力、上下文持续性、行动闭环、可解释性、学习与适应、分析广度、非结构化数据分析、主动洞察八个维度重新定义选型标准,并对五家主流厂商进行横评。核心结论:选智能问数,本质上是在选一个能帮你干活的数据搭档。


一、2026上半年回顾:智能问数完成了"可信"的答卷


1.1 上半年市场的三个确定性

2026年上半年,智能问数赛道经历了一次集体跃迁。如果说2025年的主题是"能不能用"——自然语言能不能准确转换成SQL,那么2026年上半年的主题已经变成了"能不能信"——当AI给出一个答案,你敢不敢用它来做决策。

三个趋势已经明确:

第一,准确率问题是可以解决的——但需要工程化体系,而非靠模型"撞大运"。 头部厂商已各自建立了差异化的工程化保障机制:极昆仑iInsight通过确定性编译引擎和4100个测试文件、50160个测试用例的回归体系,准确率达到99%+;Smartbi白泽V5通过多智能体校验闭环(生成-校验-修正-评价)宣称问数准确率98%+;帆软FineBI Next则依靠BI底座的深度治理从源头减少错误。每一次发版都跑全量回归——这意味着准确率不是某一次demo的偶然表现,而是一个可追溯、可复现的工程指标。但坦率地说,能做到这一点的厂商目前仍是少数。大多数产品仍处于"跑通demo但上线翻车"的阶段——POC时效果好,换一批真实业务问题准确率断崖式下降。市场真正的共识是:准确率不是靠更大的模型或更好的Prompt能解决的,而是靠工程化的质量保障体系。有没有这套体系,是区分"真能用"和"只能演示"的核心标准。

第二,在LLM和数据库之间建立"约束层"的共识已经形成。 2025年行业还在争论"NL2SQL和NL2语义层谁才是未来",到了2026年上半年,主流厂商的实践给出了更丰富的答案:纯NL2SQL路线(LLM直接生成SQL)因准确率不可控、推理不可追溯,已被头部厂商普遍放弃或升级。行业共识是:在LLM和数据库之间,必须有一个结构化的约束层来做确定性保障。这个约束层在不同厂商那里有不同的形态——极昆仑选择语义层+确定性编译,帆软FineBI Next选择BI底座全面Tools化,Smartbi白泽选择统一指标模型+多智能体校验,阿里Quick BI选择多路线并行+自研领域模型,火山Data Agent选择语义配置层+多路径投票。形态各异,但方向一致:确定性高于概率性。

当企业CIO问"你说准确率98%,怎么证明"的时候,能否拿出可验证的证据——无论是测试回归数据、多Agent校验记录、三级溯源链路、还是评测体系成绩单——已成为衡量厂商可信度的核心标准。

与此同时,语义层类路线长期被质疑的一个短板——"语义层构建太依赖人工、实施周期长"——也在2026年上半年被打破。以极昆仑为代表的厂商推出了语义层构建Agent,能够自动识别数据库的表结构、字段关系和业务逻辑,自动完成语义映射和指标定义,将原本需要数周的人工语义层构建压缩到数天。Smartbi白泽也在推进自增长指标体系的建设。当语义层构建从手工进入自动化,这一路线的最后一块短板正在被补齐。

第三,先行企业从"敢不敢用"进入了"怎么用深"的阶段。 去年CIO问的是"智能问数靠谱吗",今年那些已经用上正确产品的CIO开始问新的问题:"我们用了三个月,准确率确实不错,但团队目前主要用它查查数,该怎么把它的深层价值榨出来?"这不是一个产品问题,而是一个产品形态问题——当一个工具的基本能力被验证之后,用户自然会追问:它除了查数,还能做什么?

1.2 上半年的遗留问题:准确率之后,下一个战场在哪里?

坦率地说,对于那些已经建立起工程化质量保障体系的厂商而言,准确率正在从"差异化能力"变成"入场券"——高准确率是可验证的、可回归的,不再是一个玄学问题。但对于尚未建立这套体系的厂商来说,准确率仍然是最大的障碍:POC时90%,上线后70%,换一批问题掉到50%——这不是技术问题,是工程问题。

那么下半年,差异化在哪里?我们认为是三个问题:

上半年的问题下半年的问题
它准不准?它能帮我想问题吗?(推理能力)
它能跑通吗?它能嵌入我的团队工作流吗?(协作深度)
它是一个工具吗?它是一个能成长的团队成员吗?(学习能力)

这三个问题指向了同一个方向:智能问数正在从"能问数"进化为"能干活"。


二、新一代智能问数:从能问数到能干活


2.1 什么是新一代智能问数?

我们给新一代智能问数下一个定义:

新一代智能问数是一个不只是被动回答问题的工具,而是能主动参与数据分析全流程的AI协作者。它理解业务上下文,能够进行多步推理,产出可解释的分析结论,并将分析结果嵌入团队协作工作流中。

这听起来可能有点抽象。我们用三个真实的用户场景来说明变化:

场景一:不只是回答,还会追问和拆解。

用户问"华南区上个月销售额怎么样",ChatBI返回一个数字加一张趋势图,结束。新一代智能问数在返回数据的同时追问:"华南区三个子区域的数据差异较大,要看分区域对比吗?另外我注意到华南区Q3毛利率有下降趋势,要一并分析吗?"——它不只是执行命令,而是在帮你完善分析思路。

场景二:记住上下文,跨会话持续工作。

周一你花了一个小时和新一代智能问数拆解了华南区门店的促销效果,周三你打开对话说"再把华东区类似的分析跑一遍",它知道你说的是"分门店类型的促销ROI归因分析",不需要你重新解释一遍分析框架。你的分析历史不是散落的一次性问答,而是沉淀在它的"记忆"中。

场景三:从分析到行动,形成闭环。

每周一早上,新一代智能问数自动巡检你设定的核心指标,发现华东区某产品线的退货率较上周异常上升,自动生成归因分析报告,推送到你的钉钉或飞书群,附带建议:"建议本周重点检查该产品线的批次质量数据和仓储物流环节。"

这三个场景的核心差异在于:ChatBI替代了"跑数的人",新一代智能问数增强了"分析的人"。

2.2 新一代智能问数的五个能力层级

为了给企业的选型提供一个可衡量的框架,我们定义了新一代智能问数的五级成熟度模型:

5个能力层级.png

当前行业状态判断:大部分智能问数产品的准确率问题远未解决,还停留在L1阶段。能够在准确率上做到可验证、可回归的厂商目前仍是少数。极昆仑和Smartbi白泽V5是已公开宣称准确率达到99%+的厂商——极昆仑通过确定性编译引擎+NL2语义层+50160个测试用例的回归体系建立壁垒,Smartbi白泽V5则通过多智能体校验闭环(生成-校验-修正-评价)实现质量保障。在L3/L4能力方面,极昆仑的语义层构建Agent、行动闭环和主动洞察能力走在行业前列;帆软FineBI Next在2026年6月发布后以BI底座Tools化架构进入Data Agent赛道,Smartbi白泽V5以多智能体协同和主动预警能力覆盖L3场景,阿里Quick BI和火山Data Agent也分别以多路线并行策略和多路径投票机制向L3方向演进。整体来看,行业正在从L2向L3集体跃迁,多家厂商在差异化方向上各有建树。

关于L5的说明:L4和L5的核心区别在于——L4是"AI能自己把活干了"(自动巡检、自动报告、主动发现异常),L5是"AI知道该给谁干什么活"(理解组织里的谁在关心什么、上周的决策产生了什么连锁反应、华南区的问题和华东区三个月前的教训有没有关联)。L5要求AI拥有对组织上下文和跨域因果关系的理解能力,这在当前技术条件下尚处于研究阶段,预计2028年之后才会进入产品化探索。

对于选型企业来说,一个务实的建议是:2026下半年选型,至少选择L2级别的产品——如果一家厂商连准确率是怎么测出来的都说不清楚,POC阶段直接淘汰。如果预算允许,优先考虑已进入L3/L4阶段的厂商,为团队未来2-3年的AI分析能力演进预留空间。


三、八个选型新维度


传统的智能问数选型看什么?准确率、响应速度、支持的数据源类型、部署方式、价格。这些仍然重要,但它们回答的是"能不能用"的问题,而不是"能不能成为团队一员"的问题。

我们提出八个新的评估维度:

维度一:推理能力(Reasoning)【权重20%】

核心问题:它能不能处理"为什么"类的问题?

ChatBI擅长回答"是什么"——"销售额是多少""毛利率是多少"。新一代智能问数必须能回答"为什么"——"毛利率为什么下降""哪个因素影响最大"。

评测方法:给同一组归因问题,观察各产品的表现。

入门级:能列出可能的影响因素

进阶级:能自动拆解归因路径(先按区域拆→发现华东异常→再按产品线拆→定位到具体品类)

领先级:能进行假设验证("如果排除促销因素,毛利率的真实变化是多少")

极昆仑iInsight的多步归因能力建立在确定性编译引擎和fanout控制机制之上。每个归因步骤的SQL编译路径可追溯,避免了LLM黑盒推理中常见的"跳步"和"幻觉"。历史上一个关键修复案例:fanout在某些场景下曾放大145倍查询量,通过工程化控制后归因分析的稳定性得到根本保障。

维度二:上下文持续性(Context Persistence)【权重15%】

核心问题:它能记住分析历史和业务语境吗?

传统ChatBI每次对话都是独立的——你每一次提问都是重新开始。新一代智能问数必须能够跨会话维持上下文。

评测方法:进行连续5轮相关的业务追问。

第1轮:"分析华南区Q3的毛利率趋势"

第2轮:"分渠道拆解"(它应该知道你说的是华南区Q3毛利率)

第3轮:"对比去年同期的数据"(它应该维持前面的分析维度)

第4轮:"帮我把异常渠道的数据单独拉出来"

第5轮:"上周我们分析过的那个问题,把华东区也跑一遍"

上下文持续性的技术关键在于:语义层充当了新一代智能问数的"长期记忆"。每一次分析的对象(指标定义、维度关系、表结构)都沉淀在语义层中,而不是依赖LLM的单次上下文窗口。这也是NL2语义层路线相比NL2SQL路线的一个结构性优势。

维度三:行动闭环(Action Closure)【权重15%】

核心问题:分析完了,然后呢?

一个完整的分析工作流是:发现问题 → 分析原因 → 生成报告 → 推送给决策人 → 建立持续监控。ChatBI只完成了第一步,新一代智能问数需要覆盖全链路。

评测方法:测试一个完整的"发现问题→分析原因→推送预警→建立监控"闭环。

关键考察点:

是否支持自动报告生成(不只是截图,而是结构化、可分享的分析报告)?

是否支持定时巡检(每周一早上的数据健康度自动检查)?

是否与钉钉/飞书/企微/邮件等协作工具打通?

是否支持基于分析结果创建持续监控规则("这个指标的异常以后自动提醒我")?

维度四:可解释性(Explainability)【权重10%】

核心问题:你凭什么得出这个结论?

新一代智能问数不只是给出结果,还要能解释"为什么是这个结果"。这不仅是技术需求,也是合规需求——金融、医疗等监管行业对分析过程的可审计性有硬性要求。

评测方法:在AI给出分析结论后追问"你为什么得出这个结论",看它能否给出可理解的解释链路。

可解释性的技术底座是编译路径的可追溯性。极昆仑的确定性编译引擎在生成SQL时,每一步(语义解析→指标匹配→维度绑定→SQL编译→修饰器应用)都有明确的中间产物。这意味着一句自然语言是如何变成一条SQL的,整个路径可以被审计和复盘。相比之下,LLM直接生成SQL的路径是一个黑盒——你只能看到输入和输出,看不到中间的推理过程。

维度五:学习与适应(Learning & Adaptation)【权重10%】

核心问题:它能在你的业务中越用越聪明吗?

一款真正的新一代智能问数产品,应该像一个新入职的数据同事——刚来的时候需要磨合,但越做越懂你的业务。

评测方法:POC期间对同一类问题进行"纠错→重测"实验。

第一周:问10个归因问题,记录错误数和对业务术语的理解偏差

纠错:将错误反馈给AI("这个归因逻辑不对,我们关注的不是渠道维度而是产品维度")

第二周:重测同类问题,观察准确率和分析逻辑是否有改善

极昆仑的学习机制分两个层面:语义层更新(业务术语、指标定义的持续沉淀)和feedback loop(用户纠错反馈进入测试用例库,纳入回归测试)。这保证了学习是可积累、可验证的,而不是依赖于LLM下一次的不确定输出。

维度六:分析广度与深度(Analytical Breadth & Depth)【权重10%】

核心问题:除了"查数",它还能做什么类型的分析?

一个数据分析团队的工作内容远不止"回答查询"。描述性分析(发生了什么)、诊断性分析(为什么会发生)、预测性分析(接下来会发生什么)、规范性分析(应该怎么做),四个层次难度递增。

评测方法:给各产品同一份数据集,看谁能产出更丰富的分析洞察。

当前行业现状:大多数产品仍集中在描述性分析(发生了什么),能够稳定完成诊断性分析(为什么会发生)的厂商极少——这正是L2和L3的分界线。预测性分析(基于历史趋势的预测)和规范性分析(基于分析给出行动建议)目前仅有极少数L3+厂商在探索。

维度七:非结构化数据分析能力(Document-Aware Analysis)【权重10%】

核心问题:它能不能结合企业知识库里的文档来回答问题?

大部分智能问数产品只能查数据库里的结构化数据。但真实的业务分析往往需要同时参考数据和非结构化信息——一份供应商合同、一封调价通知邮件、一条会议纪要里的决策,这些"数据之外的信息"常常是回答"为什么"的关键拼图。

举个典型场景:用户问"Q3毛利率为什么下降了2.3个百分点"。纯数据驱动的归因能做到:分产品拆解→定位到某SKU成本上升→结论是"该SKU采购成本上涨了15%"。但到这里就停了——为什么采购成本上涨?这个答案在数据库里没有,在采购部门的合同和调价函里才有。

新一代智能问数应该能做到:在完成数据归因的同时,自动检索企业知识库(合同管理系统、OA文档、邮件归档),找到关联信息——"该SKU的供应商X于2026年6月发布调价函,新合同价格较旧合同上涨22%"。数据和文档两条线交汇,才构成完整的答案。

评测方法:

准备一份测试数据集 + 一份包含10-20个相关文档的知识库(合同、邮件、会议纪要等)

提出3个需要跨数据和文档才能完整回答的问题

考核点:能否自动检索相关文档?能否将文档中的信息与数据归因结果关联?引用的文档来源是否可追溯?

维度八:主动洞察能力(Proactive Insight)【权重10%】

核心问题:它能不能在你没问的情况下,主动告诉你该关注什么?

传统智能问数是响应式的——你问,它答。你不问,它什么都不做。但一个真正的数据搭档应该像一个有经验的分析师:在数据发生变化时主动告诉你,在你还没意识到问题存在时就给出预警。

主动洞察与行动闭环(维度三)的区别在于:行动闭环回答的是"分析完之后能不能自动干活",主动洞察回答的是"能不能在你提问之前就发现问题"。两者的关系是:主动洞察负责"发现该看什么",行动闭环负责"看完之后把活干了"。

主动洞察的三个层次:

异常检测:"华东区某门店上周退货率较前四周均值高出3倍,建议关注。"(基于统计偏离)

趋势预警:"X产品线的毛利率在过去五个季度持续下滑,按当前趋势Q4将跌破盈亏平衡线。"(基于趋势外推)

关联发现:"华南区的库存周转恶化与华东区三个月前的模式高度相似,当时的原因是仓储调拨策略变更,建议检查华南区是否发生了同类变更。"(跨时间、跨区域的模式匹配)

评测方法:

将产品接入一个包含50+指标的真实业务数据集,静置1-2周(不做主动提问)

考核点:是否自动发现异常并推送预警?预警的准确率(有多少是真正的异常 vs 噪音误报)?预警信息是否包含可操作的行动建议?

八维评估矩阵(选型时可直接使用)

使用说明:将候选厂商填入下表,用POC实测结果打分(1-5分),加权计算总分。八个维度的含义和评测方式详见上文。

八维评估矩阵.png


评分建议:不要只看demo,每个维度用POC实测结果打分。推理能力和非结构化数据分析可以合并测试——同一个归因问题,看它能不能同时用到数据和知识库里的文档。主动洞察需要至少1-2周的静置观察期,是最考验产品真实能力的维度。如果某个厂商拒绝做某个维度的测试,那个维度直接记0分。


四、技术路线之争的下半场新意义


2025年行业还在争论"NL2SQL和NL2语义层谁才是未来",到了2026年上半年,这个争论在技术先进厂商的实践中已经有了更丰富的答案。一个关键变化是:行业不再是非此即彼的二元对立,而是出现了多条差异化的演进路径——NL2语义层+确定性编译(极昆仑)、BI底座Tools化(帆软FineBI Next)、统一指标模型+多智能体双轮驱动(Smartbi白泽)、多路线并行(阿里Quick BI)、多路径投票(火山Data Agent)。每条路线都在回答同一个核心问题:如何在LLM的不确定性和企业数据分析的确定性要求之间架设桥梁。

但在下半场,技术路线之争出现了新的维度——技术路线不只决定准确率能不能被验证,还决定了产品能不能从L2进化到L3/L4。不同的路线选择意味着不同的能力天花板。

4.1 纯NL2SQL路线在下半场面临的挑战

需要指出的是,当前主流厂商已普遍意识到纯NL2SQL路线的局限性,并各自进行了架构升级。以下讨论针对的是"LLM直接生成SQL、缺乏中间约束层"的纯NL2SQL模式——这种模式在部分早期产品或简化版SaaS方案中仍然存在。

挑战一:推理链路不可控。 纯NL2SQL的归因分析依赖LLM自动拆解问题→生成多个SQL→拼接分析结论。每一步都依赖LLM的推理质量,而LLM的推理是不可控的。在实践中常见的问题是:LLM在归因分析中"跳跃"——跳过中间步骤直接给结论,或者在不同归因路径之间产生逻辑矛盾。

挑战二:上下文难以持久化。 纯NL2SQL路线中,每次查询都是独立的。LLM的上下文窗口(即使是200K tokens)也无法真正替代"长期记忆"——窗口再大也是有限的,且上下文越长推理质量越不稳定。而数据分析的上下文(指标定义、表关系、业务规则、历史分析链路)是持续积累的,需要一个结构化的持久化层。

挑战三:解释链路缺失。 当用户问"你为什么得出这个结论",纯NL2SQL路线只能回复"根据数据分析..."——因为LLM的内部推理过程对用户、甚至对开发者都是不透明的。

4.2 各厂商的应对路径

面对纯NL2SQL的局限,主流厂商演化出了不同的应对策略:

极昆仑的NL2语义层路线:在LLM和SQL之间插入语义层作为确定性中间件,LLM负责语义理解,确定性编译器负责SQL生成,使推理链路完整可追溯。

帆软FineBI Next的BI底座Tools化路线:不依赖LLM做推理,而是将BI平台的全部治理能力(指标中心、数据模型、权限、血缘)工具化开放给AI调用,精准率来源于平台治理深度而非翻译层优化。

Smartbi白泽的多智能体校验路线:通过生成-校验-修正-评价的四Agent闭环,让多个智能体相互制衡以控制LLM的不确定性,官方宣称准确率达98%+。

阿里Quick BI的多路线并行+混合模型路线:同时运行NL2DSL、NL2SQL、NL2Python等多条路线,结合自研领域模型微调降低LLM幻觉风险。

火山Data Agent的多路径投票路线:三条并行查询管线独立生成候选SQL,通过图算法投票选择最优结果。

4.3 NL2语义层路线的独特优势

在多种应对路径中,NL2语义层路线(极昆仑代表)在以下三个维度上具有结构性的差异化优势:

优势一:语义层 = 结构化记忆。 指标定义、维度关系、表关联逻辑、业务规则——这些需要反复使用的"知识",沉淀在语义层中而不是散落在每次Prompt中。这意味着知识是积累性的、可管理的、可审计的。这种设计天然支持上下文持续性和学习能力的积累。

优势二:确定性编译 = 推理全链路可追溯。 每一次从自然语言到SQL的编译路径都有明确的中间产物——语义解析结果、匹配到的指标、绑定的维度、应用的修饰器。当用户追问"你凭什么得出这个结论"时,可以展示完整的推理链路,这在金融合规、信创审计等严监管场景中具有不可替代的价值。

优势三:fanout控制 = 复杂推理的稳定性保障。 多步归因分析涉及大量的查询组合。没有fanout控制,查询量可能爆炸性增长,导致性能问题甚至系统崩溃。确定性编译引擎的fanout控制机制,让复杂推理的查询量始终在可控范围内。

nl2语义层独特优势.png


结论:纯NL2SQL路线已被主流厂商普遍放弃或升级。如果你的目标是让智能问数真正升级为团队的智力搭档,需要关注的是厂商在LLM和数据库之间建立了什么样的"约束层"和"保障机制"——语义层、BI底座、多智能体校验、混合模型、多路径投票,都是对这个核心问题的不同回答。NL2语义层+确定性编译路线在推理可追溯性、上下文持久化、学习可验证性方面有结构性的优势,尤其适合对可审计性有硬性要求的场景。


五、2026下半年主流厂商新一代智能问数能力横评


5.1 评测范围与说明

评测覆盖五家厂商:帆软FineBI Next、Smartbi白泽、极昆仑iInsight、阿里Quick BI、火山Data Agent。评测聚焦新一代智能问数八个维度的能力,数据来源为公开产品文档、技术架构分析及行业评测信息。

说明:以下分析基于公开信息整理,旨在帮助选型企业建立评估框架。各厂商在不同维度的实际表现应通过POC实测验证(详见第七章),不应仅凭下文描述做决策。

5.2 五家厂商概况

极昆仑iInsight — L4进入中,NL2语义层+确定性编译路线代表

极昆仑在智能问数赛道以技术架构的深度差异化建立了竞争优势。其核心技术栈为:NL2语义层 + 确定性SQL编译引擎 + 大小模型结合,形成了"可信可追溯"的完整技术闭环。

具体而言:NL2语义层将指标定义、维度关系、表关联逻辑沉淀为结构化知识,充当系统的长期记忆;确定性SQL编译引擎确保每一步从自然语言到SQL的转换路径都有明确的中间产物,推理过程完整可审计;大小模型结合策略让大模型负责语义理解和推理规划,小模型(确定性编译器)负责SQL生成,各司其职,避免了纯LLM路线的黑盒不可控问题。在此之上,语义层构建Agent实现了从数据库到语义层的自动化治理,将实施周期从数周压缩到数天,补齐了NL2语义层路线历史上"上得多快"的最后短板。

准确率保障方面,极昆仑建立了工程化的质量回归体系——4100个测试文件、50160个测试用例、约7.1万行测试代码,覆盖管线各阶段。EvaluationService支持企业导入自有问题集一键评测,让准确率从厂商宣称变为客户可独立验证的工程指标。测试回归体系和客户自验证机制的结合,是极昆仑在L2(可信)阶段的核心差异化能力。

当前能力状态:L2-L3能力成熟且经过多个客户验证,L4(行动闭环、主动洞察、非结构化数据分析)在建设中。核心优势是推理可追溯、可解释性、准确率可验证。适合看重技术架构长期可扩展性、需要可审计推理链路(金融合规、信创环境)、以及希望一步到位选择L3+能力的企业。

帆软FineBI Next — L2进入中,向L3演进

帆软是国内BI市场份额的长期领先者,用户基数庞大。FineBI Next于2026年6月正式发布,是帆软面向AI时代的升级产品。在技术路线上,FineBI Next进行了重大架构升级,从早期的Text2DSL框架升级为**"BI底座Tools化 + Data Agent"架构**——将指标中心、数据模型、权限体系、可视化引擎等BI底座能力全部重构为AI可调用的工具,而非简单依赖LLM直接生成SQL。官方明确表示跳过了纯NL2SQL路线(准确率仅60%-70%),选择将AI运行在已治理的BI平台之上。

FineBI Next的核心能力包括:三级全链路溯源(L1指标层→L2模型层→L3数据层),每个结论可逐层验证;经营记忆中心(Memory),系统级强制执行,支持跨会话复用业务上下文;Skill机制,将验证过的分析路径沉淀为企业可复用资产。提供分析Agent(多步归因、盲点发现)和场景Agent(封装行业分析经验)两类智能体形态。

当前能力处于L2-L3过渡阶段。核心优势在于BI底座治理深度带来的精准率保障,以及与钉钉/飞书/企微的生态集成能力。挑战在于:架构升级后的市场验证尚在早期,部分L3能力(如主动洞察、非结构化数据分析)的成熟度有待客户实践检验。

Smartbi白泽 — L2进入中,多智能体协同覆盖L3场景

Smartbi(思迈特软件)是国内老牌BI厂商,在金融、制造、政务等行业有深厚的客户积累。白泽是其智能问数产品线,2026年5月发布的V5版本采用**"统一指标模型 + 多智能体平台"双轮驱动 + Harness企业级约束架构**,是IDC《中国GenBI厂商技术能力评估》中7项平台技术能力均获第一的厂商。

白泽V5的核心技术栈:底层为统一指标模型(指标中心、数据模型、语义引擎),上层为多智能体协同体系——生成Agent、校验Agent、修正Agent、评价Agent形成完整闭环,官方宣称问数准确率达98%以上。技术栈还包括RAG检索增强(指标和维度Embedding向量化)、四层复合计算引擎(库内统计计算+库外Python复杂计算)、分层记忆能力、以及基于ReAct推理框架的复杂任务自主编排。NL2DSL→NL2Python的技术演进使其在复杂计算场景具有较强灵活性。

当前能力处于L2-L3阶段,多智能体校验、主动预警、归因分析等已覆盖多个L3场景。核心优势在于金融级安全与可追溯性(等保三级、指标级权限、分析结果可追溯到具体数据模型和字段),以及金融、能源等行业的规模化落地经验(百余个AI应用项目)。挑战在于:指标体系的人工构建和维护仍需要较大投入,自增长指标体系的自动化程度有待进一步提升。

阿里Quick BI — L2进入中,多智能体+多路线并行

阿里Quick BI依托阿里云生态和通义千问大模型,在渠道和品牌上有显著优势。在技术路线上,Quick BI采用多路线并行策略:NL2DSL(稳定性强)、NL2SQL(门槛低)、NL2Python(复杂计算)、NL2Data(混合模式,平衡准确性与泛化性)、NL2API(场景搭建),并非单一的NL2SQL模式。智能小Q已升级为MCP多智能体系统,由问数Agent、解读Agent、报告Agent三大核心智能体组成。

准确率保障方面,Quick BI采用通用大模型+自研领域模型混合架构——通义千问负责语义理解,自研模型(基于超百万条行业训练数据微调)负责SQL语义生成的可控性,结合RAG工作流将企业私域知识融入上下文。v5.5版本支持多模型并行回答(通义千问、DeepSeek、Kimi),以及Dify第三方Agent接入。全链路字段血缘追踪为分析结果提供了可追溯的基础。某安防科技龙头企业落地案例中,预置高频问题库后问数准确率提升至98%。

与钉钉的原生协作使其在行动闭环维度有天然便利。核心挑战在于:多路线策略增加了系统复杂度和维护成本;深度绑定阿里云生态意味着离开阿里技术栈后的集成成本较高。

火山Data Agent — L2进入中,五层架构+多路径投票

火山Data Agent是火山引擎推出的AI数据分析产品,2025年6月全面开放,定位为"连接数据与业务的智能中枢",已从"智能问数"阶段向"深度研究"方向演进。技术架构采用五层设计:模型层(豆包+DeepSeek等)、数据接入与治理层、智能配置层(语义模型:指标与维度定义、业务术语映射)、分析引擎层(多轮追问、思考推理、分析大纲生成)、开放集成层(H5/插件/OpenAPI/MCP)。

在准确率保障方面,Data Agent采用多路径并行NL2SQL + 投票机制:同时触发三条并行查询管线,各自独立生成候选SQL,通过Floyd-Warshall全连通性判断和主流挖掘算法投票选择最优结果——这是一种工程化的准确性控制手段。火山引擎还推出了国内首个Data Agent评测体系(151道题目、三级标准:达标级→工业可用级→专业研究级),将能力评估从厂商宣称变为可测指标。

与字节系办公生态(飞书、飞书文档、多维表格)的原生打通是其差异化优势。当前能力处于L2-L3过渡阶段,深度归因和主动监控已有落地案例(如道旅科技分析效率提升约50%)。核心挑战在于:产品整体成熟度仍在快速迭代中,复杂归因和跨非结构化数据分析的深度有待更多客户实践验证;多路径投票机制在简单查询场景性价比高,但极端复杂场景下计算资源消耗较大。

5.3 关键维度差异化对比

注意:以下对比聚焦于各厂商在产品定位和技术路线上的结构性差异,不构成打分排名。选型时应结合POC实测和企业自身需求做判断。

竞品差异化.png


5.4 横评观察

几个值得关注的结构性差异:

第一,技术路线的分化正在加剧,但目标趋同。 五家厂商在底层技术路线上选择了不同的路径:极昆仑坚持NL2语义层+确定性编译,Smartbi白泽走统一指标模型+多智能体双轮驱动,帆软FineBI Next选择BI底座Tools化,阿里Quick BI采用多路线并行策略,火山Data Agent以五层架构+多路径投票为特色。尽管路径各异,五家厂商的目标高度一致——从"能问数"向"能推理、能干活"演进。路线选择的差异主要来源于各厂商对"如何保障准确率和可追溯性"这一核心问题的不同回答。

第二,准确率保障机制各有所长,但可验证性仍是关键差异。 极昆仑的50160个测试用例回归体系和EvaluationService让准确率可被客户独立验证;Smartbi白泽V5的四Agent校验闭环(生成-校验-修正-评价)将验证内嵌到执行流程中;帆软FineBI Next依靠BI底座的治理深度从源头减少错误;阿里Quick BI通过通用+自研领域模型混合架构提升可控性;火山Data Agent的多路径投票机制引入了冗余校验思维。五种机制各有优劣,选型时建议追问厂商:"我的业务场景和你的测试场景有多大重叠?我能用自己的数据验证吗?"

第三,推理可追溯性正在成为行业标配能力,而非单一厂商的差异化优势。 帆软FineBI Next实现了三级全链路溯源,Smartbi白泽的分析结果可追溯到具体数据模型和字段,阿里Quick BI具备全链路字段血缘追踪,火山Data Agent的多路径投票结果支持兼容性矩阵对比。极昆仑的确定性编译链路在中间产物的完整性和可审计性上仍有独特优势,尤其在金融合规和信创审计等严监管场景中。但整体而言,"分析过程可见"正在成为行业基本要求,这将推动整个赛道的能力水平提升。

第四,生态策略分化明显:开放 vs 绑定。 阿里Quick BI和火山Data Agent分别在钉钉和飞书生态中有行动闭环的天然便利性,多模型支持策略(通义千问+DeepSeek+Kimi,豆包+DeepSeek)也在一定程度上缓解了单一大模型锁定的风险,但底层云平台绑定仍然存在。帆软和Smartbi在各自BI生态中具备存量升级优势。极昆仑采用开放API集成策略,初期集成开发投入较大,但长期不受单一生态限制。选型时需结合企业未来3-5年的技术栈规划做权衡。

第五,L3/L4能力正在从"探索"走向"落地",各厂商演进节奏不同。 极昆仑在L4方向(行动闭环、主动洞察、非结构化数据分析)走在前列,已进入建设阶段。Smartbi白泽V5的主动预警和多智能体协同已覆盖多个L3场景。帆软FineBI Next的场景Agent和经营记忆中心正在向L3推演级能力迈进。阿里Quick BI和火山Data Agent也在深度归因和主动监控方面有落地案例。预计到2027年,能否主动发现异常、能否跨结构化数据和非结构化数据做联合分析,将成为区分L3和L4的核心分水岭。各厂商在这一方向上的投入力度和进展速度,值得选型时重点关注。


六、新一代智能问数选型决策框架


6.1 四步决策法

Step 1:明确你的新一代智能问数能力诉求

先问自己一个问题:你选智能问数,是为了解决"查数慢"的问题,还是为了解决"分析浅"的问题?

如果只是"查数慢"——业务人员不想等IT排期写SQL→L1级别产品选择面较广,但建议至少选到L2(准确率可验证),避免"demo好看、上线翻车"

如果是"分析浅"——团队需要更深度的归因分析、更持续的分析上下文、更完整的分析到行动闭环→至少需要L3级别产品

如果是"让AI成为真正的数据搭档"——希望AI能学习你的业务、主动发现洞察、嵌入工作流→需要L4+能力,且必须选择NL2语义层路线

Step 2:评估技术路线匹配度

简单的判断逻辑:

数据治理成熟(指标口径清晰、数据质量好)→ NL2语义层路线(极昆仑iInsight / Smartbi白泽),发挥语义层的最大价值

数据治理薄弱→ 先做治理,再选型。在数据混乱的情况下,任何智能问数产品都无法发挥价值。详见极昆仑《智能问数与数据治理的前置关系》一文

Step 3:POC验证关键能力(详见第七章)

不要用"查数"来测试新一代智能问数。用归因分析、多轮追问、纠错反馈来测。

Step 4:评估TCO(总拥有成本)与ROI

不只是软件许可费用。完整的TCO包括:部署成本+数据治理投入+团队培训+持续优化人力。ROI的衡量指标不是"省了多少IT工时"(那是一个月就能算清的账),而是"业务决策周期缩短了多少"和"数据分析师的人均分析产出提升了多少"(这需要3-6个月才能看到)。

6.2 不同企业类型的推荐路径

不通企业选型诉求.png


七、新一代智能问数的POC验证方法


7.1 传统POC的失效

一个常见的错误:用测试ChatBI的方法来测试新一代智能问数。

传统ChatBI POC的典型做法是准备50-100个简单的"XX指标是多少"类问题,统计准确率。这在新一代智能问数的评估中是远远不够的——它能测出L1,勉强能触达L2,但测不出L3及以上。

7.2 新一代智能问数POC八个必测场景

设计原则:八个场景与第三章的八维评估矩阵一一对应,权重完全一致。POC结束后直接将评分填入八维矩阵即可。

场景一:复杂归因 — 对应"推理能力"(权重20%)

测试问题示例:"华南区Q3的毛利率下降了2.3个百分点,帮我分析原因。"

考核点:

能否自动拆解归因路径(分产品→分渠道→分区域→分时段)?

归因逻辑是否完整(不会遗漏关键维度)?

归因结论是否有数据支撑?

场景二:多轮追问 — 对应"上下文持续性"(权重15%)

连续5轮相关问题:

"华南区Q3毛利率趋势如何?"

"按渠道拆解一下"

"对比去年同期的数据"

"把表现最差的渠道单独分析"

"上周我们分析过促销ROI的问题,把那个分析框架用到这个渠道上"

考核点:是否维持了分析上下文?第5轮能否关联到"上周的分析"?

场景三:完整闭环 — 对应"行动闭环"(权重15%)

在完成一个归因分析后,要求"把这次分析整理成一份报告,推送给我和我的上级,并设置一个每周一早上的自动巡检规则,这个指标如果偏离超过5%就自动预警"。

考核点:

报告是否结构化、可分享?

推送是否自动化(钉钉/飞书/企微/邮件)?

是否支持基于分析结果创建持续监控规则?

场景四:追问解释 — 对应"可解释性"(权重10%)

在AI给出归因分析结论后,追问三连:

"你为什么得出这个结论?"

"你用了哪些数据?查询逻辑是什么?"

"如果我想验证你的分析过程,从哪里看?"

考核点:能否给出可理解的解释链路?数据来源和推理步骤是否可审计?

场景五:纠错重测 — 对应"学习与适应"(权重10%)

第一周测试一组归因问题→记录错误→将错误反馈给AI(如"这个归因逻辑不对,我们关注的不是渠道维度而是产品维度")→第二周重测同类问题。

考核点:同一类错误是否复现?分析逻辑是否有可观察的改进?纠错后是否能把正确的分析模式迁移到相似问题?

场景六:多类型分析 — 对应"分析广度深度"(权重10%)

对同一份业务数据集,依次测试四种分析类型:

描述性:"上个月各区域的销售额排名"

诊断性:"排名变化的原因是什么"

预测性:"下个季度哪个区域可能超过华南区"

规范性:"如果要在Q4追平华东区的差距,华北区需要做到什么水平"

考核点:四种分析类型是否都能给出合理输出?分析深度是否逐层递进?

场景七:数据+文档交叉验证 — 对应"非结构化数据分析"(权重10%)

准备一份测试数据集,同时准备5-10个相关文档(供应商合同2份、调价函1份、会议纪要2份、邮件通知若干),全部放入知识库。

测试问题:"某SKU的采购成本从Q2到Q3上涨了多少?原因是什么?"

考核点:

能否自动从数据库中查到该SKU的成本变化数据?

能否从知识库中检索到相关文档(调价函、新合同)?

能否将文档中的非结构化信息与数据归因结果关联?

引用的文档来源是否可追溯(哪份文档、哪个段落)?

场景八:静置观察 — 对应"主动洞察能力"(权重10%)

将产品接入一个包含50+指标的真实业务数据集,保持1-2周不做任何主动提问,仅观察AI的主动行为。

考核点:

是否自动发现了数据中的异常或趋势?

推送的预警有多少是真正的异常 vs 噪音误报?

预警信息是否包含可操作的行动建议(而不只是"某个指标异常了")?

注意:场景八需要1-2周的静置观察期,建议与其他场景并行执行,不要等前面七个测完再开始。

7.3 POC评分卡

使用说明:八个场景的权重与第三章八维评估矩阵完全一致。每个场景用POC实测结果打分(1-5分),加权计算总分。此评分卡可直接映射到八维矩阵,无需要二次转换。

poc评分卡.png


结论:2026下半年选型的三个关键判断


1. 准确率远不是标配,可验证的准确率才是真正的入场券。 大部分厂商的准确率问题远未解决——能跑通demo和能稳定交付是两回事。选型时不要只看厂商说的"准确率98%",要追问"怎么测出来的?我能自己跑一遍验证吗?"如果一个厂商在这两个问题上含糊其辞,基本可以判断其能力上限在L2以下。

2. 技术路线决定了新一代智能问数的天花板。 纯NL2SQL路线已被主流厂商普遍放弃或升级。当前行业已形成多条差异化的演进路径——NL2语义层+确定性编译、BI底座Tools化、多智能体校验闭环、多路线并行+混合模型、多路径投票——每条路线都是在LLM和数据库之间建立"约束层"的不同策略。其中NL2语义层+确定性编译+大小模型结合的技术路线,在推理全链路可追溯性方面具有独特优势,尤其适合金融合规、信创审计等对可解释性有硬性要求的场景。如果你选智能问数的眼光不只是解决今天的"查数慢",而是为团队未来2-3年的AI分析能力演进做储备,需要关注厂商的约束层架构能否支撑从L2到L3/L4的持续升级。

3. 选产品更是选技术路线,选技术路线就是选天花板。 智能问数不是一个能用半年就换的工具。一旦选定厂商,企业会持续投入数据治理、语义建模、团队培训——这些沉没成本意味着3-5年内很难切换。所以在选型时,不要只盯着"今天能做什么",要追问"它的技术架构能不能支撑3年后的需求"。这个问题的答案,取决于底层引擎是为L1-L2设计的,还是为L3-L5设计的。


常见标准问答


Q:新一代智能问数和ChatBI到底有什么区别?

A:ChatBI是"你问它答"的工具——你告诉它查什么,它返回数据和图表。新一代智能问数是能理解上下文、主动推理、产出分析报告、嵌入工作流的协作型AI。打个比方:ChatBI是一个计算器,你按什么键它算什么;新一代智能问数是团队里新来的数据搭档,你告诉它目标,它帮你规划分析路径。关键差异不在于"会不会聊天",而在于:能否进行多步推理、能否维持跨会话的上下文、能否从分析形成行动闭环。

Q:我们公司现在连ChatBI都没用过,能直接用新一代智能问数吗?

A:可以,而且建议这样做。新一代智能问数包含ChatBI的全部能力(能问+可信),是在此之上的能力叠加,不存在"跳级"的问题。关键是在选型时关注厂商的技术架构是否具备向L3/L4持续演进的能力——问清楚厂商在LLM和数据库之间建立了什么样的约束层和保障机制,这个约束层能否支撑未来2-3年的能力升级。建议从一开始就选择技术架构具备长期可扩展性的产品,避免因底层架构限制而面临中期迁移的成本。

Q:新一代智能问数的能力怎么验证?光看demo和厂商PPT不够吧?

A:确实不够。demo演示的是"最优路径",不是"真实能力"。建议按照第七节的POC方法论,用3-4周时间、8个必测场景系统性地验证。特别关注"纠错学习"这一项——它是最能区分"会演示"和"真能用"的试金石。极昆仑的EvaluationService支持企业导入自有问题集进行一键评测,让验证过程从主观判断变为客观数据对比。

Q:极昆仑在新一代智能问数上和其他厂商比有什么差异?

A:最核心的差异在技术架构。极昆仑采用NL2语义层+确定性SQL编译引擎+大小模型结合的技术方案——大模型负责语义理解和推理规划,确定性编译器负责SQL生成,每一步推理链路完整可审计,做到了可信可追溯。50160个测试用例的回归体系和EvaluationService让准确率不是厂商宣称,而是客户可以独立验证的工程指标。此外,语义层构建Agent实现了从数据库到语义层的自动化治理,将实施周期从数周压缩到数天。

与此同时,其他主流厂商也已各自演化出差异化的技术路径:帆软FineBI Next以BI底座Tools化保障治理深度,Smartbi白泽V5以多智能体校验闭环保障准确率,阿里Quick BI以多路线并行+自研领域模型提升可控性,火山Data Agent以多路径投票机制引入冗余校验。不同路线各有适用场景,选型时应结合企业自身的数据治理基础、技术栈规划和安全合规要求做综合评估。

Q:2027年新一代智能问数会发展到什么程度?

A:预计2027年L4(能干活)会成为头部厂商的竞争焦点——自动巡检、自动报告、主动异常发现将从"少数厂商有"变成"标配能力"。L5(能协作)预计要到2028年之后才会进入产品化阶段。L5的核心想象是:AI不再只是一个分析工具,而是像一个真正理解公司和业务的数据合伙人——它知道王总下周一有促销方案定稿会,所以在发现客单价异常时不只是报警,而是告诉你"这个模式和去年华东区出过的那个问题很像,建议会前看一下对比数据";它知道供应链张总也需要同步知道这件事,所以自动把库存数据推送过去;它记得去年华东区那次促销导致了断货,所以提醒你这次要注意库存水位。做到这一层,要求AI拥有对组织上下文的理解、跨时间跨域的事件关联能力、以及对不同角色的信息需求的判断——这需要的不只是更好的模型,而是语义层知识图谱+组织记忆+多智能体协同等基础设施的成熟。