AI Agent 正在重塑企业数据的使用方式。从信贷风控到商机挖掘,越来越多业务场景开始让AI直接调用企业工商、司法、风险等专业数据。企查查围绕其MCP(Model Context Protocol)能力,持续探索专业数据如何被AI Agent 可信调用、协议化接入、计量消费。
但一个基础问题始终悬而未决:接进来的数据,质量到底行不行?
企查查技术总监杜虎给出了一个系统性答案——从POC(验证性测试)阶段就把质量关提前做好,而不是等签约后才发现"货不对板"。
一、如何对比数据质量?
很多企业采购数据服务时,POC流程长这样:服务商发一份样表,客户填好需求,数日后收返表,打个分,排个名。
看起来高效,但隐患巨大。
杜虎指出,如果提前暴露完整计分名单,服务商完全有可能针对已知对象额外查询外部来源、人工补齐甚至替换数据。 返表结果可能准确,但它验证的是"经过专项处理后的这批样本",而非"按采购条件持续交付的日常质量"。
换句话说,你看到的是一份精心准备的答卷,但你买的是全年考试的稳定发挥。
这不是指责谁作弊,而是指出方法论上的根本缺陷:测试条件与正式交付条件脱节。
二、四个动作,让测试"不失真"
杜虎提出了一套客户主导的质量验证方法,核心是四个动作:
第一,先联调,再用受控样本。 公开规则和非计分样例,正式样本由客户保管、不提前完整暴露计分对象。兼顾业务分布与重点难例,两组结果分别说明,不把专项难例成绩直接推为总体质量。
第二,按拟采购的常规条件测试。 对齐产品、权限、字段、加工流程、规模、时限和更新条件;披露测试与正式服务之间的差异。
第三,保存第一次完整结果。 成功、缺失、失败、超时、分页和时点全部留档。修复另建复测批次,不覆盖首测证据。
第四,开测前就安排后续复验。 约定新样本、跨时间及正式交付后的检查范围和偏差处理,不等签约后才讨论验收标准。
一句话总结:客户主导不等于客户独自执行,关键是规则、样本、证据和裁决权由客户掌握。

三、三种测试方式:按交付形态选路径
根据拟采购的交付形态,杜虎梳理了三种执行方式——
方式1:客户清单,限时批量交付——适用于离线数据包、企业名录清洗补全。客户统一发出正式清单,服务商按常规流程交付,截止时封存完整文件与未完成项。
方式2:实时在线调用API——适用于拟采购在线接口。客户在约定窗口自行执行或现场见证,每次保存完整首响应、调用时点、分页、超时和重试。
方式3:AI工作台+MCP受控调用——适用于服务商提供MCP服务的场景。客户用未曝光样本,按固定规则逐家调用,按服务商分别封存完整返回。
三种方式共同的底线是:不能把AI聊天摘要当证据,不能用模型记忆补某家的缺失再算分。

四、AI不替服务商"圆谎"
杜虎指出:AI没有编造答案,不代表它拿到的数据就是正确的;答案有来源,也不代表来源的数据质量已经得到验证。
如果A家缺少某字段,AI从B家结果或模型记忆中补齐,再生成完整报告——这可以辅助综合研判,但绝不能算作A家的数据质量成绩。
MCP的structuredContent是服务端产生的结构化结果,与模型按格式重新生成的"结构化输出"完全不同。结构符合要求不等于事实正确。
杜虎给出的分工很清晰:AI辅助规划、整理和解释;MCP负责连接与调用;评分依赖预先确认的规则和独立证据;争议由客户或约定评审人裁决。
五、复核四问:数据到底好不好用?
拿到测试结果后,采购方不应只看字段填没填满、条数够不够多。杜虎建议按业务用途逐项回答四个问题:
主体对不对? 同名、更名、集团关联企业,应核对统一社会信用代码等主体标识。
重要信息有没有漏或报错? 不能只抽查已返回记录,"未查到"不等于"确认无风险"。
变化能否及时体现? 验证变化何时进入服务,而不只是接口返回快不快。
结果是否符合实际用途? 按约定的合格新增线索评价,不能仅用交付条数判断。
同时要让关键质量真正影响评价——按事前约定单列错配、关键漏报、误报及更新延迟,避免被大量普通字段的"高分"掩盖。
重要提示:本文著作权归财中社所有。未经允许,任何单位或个人不得在任何公开传播平台上使用本文内容;经允许进行转载或引用时,请注明来源。联系请发邮件至editor@caizhongshe.cn。