企查查AI观察:AI用上企业数据,质量这关怎么过?

<{$news["createtime"]|date_format:"%Y-%m-%d %H:%M"}>  财中社 杨楚欣 1.3w阅读 2026-09-17 17:47
企查查提出AI数据质量POC方法:客户主导、受控样本、按采购条件测试,AI不替服务商补缺,评分依赖独立证据与规则,确保AI调用企业数据可信。

AI Agent 正在重塑企业数据的使用方式。从信贷风控到商机挖掘,越来越多业务场景开始让AI直接调用企业工商、司法、风险等专业数据。企查查围绕其MCP(Model Context Protocol)能力,持续探索专业数据如何被AI Agent 可信调用、协议化接入、计量消费。

但一个基础问题始终悬而未决:‌接进来的数据,质量到底行不行?‌

企查查技术总监杜虎给出了一个系统性答案——‌从POC(验证性测试)阶段就把质量关提前做好,而不是等签约后才发现"货不对板"。‌

一、如何对比数据质量?

很多企业采购数据服务时,POC流程长这样:服务商发一份样表,客户填好需求,数日后收返表,打个分,排个名。

看起来高效,但隐患巨大。

杜虎指出,‌如果提前暴露完整计分名单,服务商完全有可能针对已知对象额外查询外部来源、人工补齐甚至替换数据。‌ 返表结果可能准确,但它验证的是"经过专项处理后的这批样本",而非"按采购条件持续交付的日常质量"。

换句话说,你看到的是一份精心准备的答卷,但你买的是全年考试的稳定发挥。

这不是指责谁作弊,而是指出方法论上的根本缺陷:测试条件与正式交付条件脱节。

二、四个动作,让测试"不失真"

杜虎提出了一套客户主导的质量验证方法,核心是四个动作:

第一,先联调,再用受控样本。‌ 公开规则和非计分样例,正式样本由客户保管、不提前完整暴露计分对象。兼顾业务分布与重点难例,两组结果分别说明,不把专项难例成绩直接推为总体质量。

第二,按拟采购的常规条件测试。‌ 对齐产品、权限、字段、加工流程、规模、时限和更新条件;披露测试与正式服务之间的差异。

第三,保存第一次完整结果。‌ 成功、缺失、失败、超时、分页和时点全部留档。修复另建复测批次,不覆盖首测证据。

第四,开测前就安排后续复验。‌ 约定新样本、跨时间及正式交付后的检查范围和偏差处理,不等签约后才讨论验收标准。

一句话总结:‌客户主导不等于客户独自执行,关键是规则、样本、证据和裁决权由客户掌握。‌

三、三种测试方式:按交付形态选路径

根据拟采购的交付形态,杜虎梳理了三种执行方式——

方式1:客户清单,限时批量交付‌——适用于离线数据包、企业名录清洗补全。客户统一发出正式清单,服务商按常规流程交付,截止时封存完整文件与未完成项。

方式2:实时在线调用API‌——适用于拟采购在线接口。客户在约定窗口自行执行或现场见证,每次保存完整首响应、调用时点、分页、超时和重试。

方式3:AI工作台+MCP受控调用‌——适用于服务商提供MCP服务的场景。客户用未曝光样本,按固定规则逐家调用,按服务商分别封存完整返回。

三种方式共同的底线是:‌不能把AI聊天摘要当证据,不能用模型记忆补某家的缺失再算分。‌

四、AI不替服务商"圆谎"

杜虎指出:‌AI没有编造答案,不代表它拿到的数据就是正确的;答案有来源,也不代表来源的数据质量已经得到验证。‌

如果A家缺少某字段,AI从B家结果或模型记忆中补齐,再生成完整报告——这可以辅助综合研判,但绝不能算作A家的数据质量成绩。

MCP的structuredContent是服务端产生的结构化结果,与模型按格式重新生成的"结构化输出"完全不同。‌结构符合要求不等于事实正确。‌

杜虎给出的分工很清晰:AI辅助规划、整理和解释;MCP负责连接与调用;评分依赖预先确认的规则和独立证据;争议由客户或约定评审人裁决。

五、复核四问:数据到底好不好用?

拿到测试结果后,采购方不应只看字段填没填满、条数够不够多。杜虎建议按业务用途逐项回答四个问题:

主体对不对?‌ 同名、更名、集团关联企业,应核对统一社会信用代码等主体标识。

重要信息有没有漏或报错?‌ 不能只抽查已返回记录,"未查到"不等于"确认无风险"。

变化能否及时体现?‌ 验证变化何时进入服务,而不只是接口返回快不快。

结果是否符合实际用途?‌ 按约定的合格新增线索评价,不能仅用交付条数判断。

同时要‌让关键质量真正影响评价‌——按事前约定单列错配、关键漏报、误报及更新延迟,避免被大量普通字段的"高分"掩盖。

重要提示:本文著作权归财中社所有。未经允许,任何单位或个人不得在任何公开传播平台上使用本文内容;经允许进行转载或引用时,请注明来源。联系请发邮件至editor@caizhongshe.cn。

最新文章推荐

长按保存图片