一份PDF格式的供应商可持续发展报告被上传后,AI在几分钟内把里面提到的能耗、排放、用水数据都提取了出来,团队负责人看着结果表格,第一反应是"这下轻松了",但表格里"1200"这个数字后面跟着的单位是MWh还是GJ,报告正文和附注里写的是不是同一个口径,没有人核对过。

文档:同一份报告里,数字从来不是孤立存在的

一份ESG报告或供应商问卷通常有几十页,排放数据可能出现在正文表格、脚注、附录甚至图表标题里。同一个指标,正文写的是"范围一排放12,400吨",附录里可能重复出现一次,单位却写成"12.4千吨";有的报告在能耗部分用兆瓦时(MWh),到了排放部分又换成吉焦(GJ)。AI在读取文档阶段要做的第一件事,不是急着抓数字,而是先识别这份文档的结构——哪些是正文陈述、哪些是脚注说明、哪些是同一指标的重复披露。如果跳过这一步直接抓取,很容易把脚注里的行业平均值当成企业自己的实测数据,或者把去年同期对比数字当成当期数据。更常见的情况是,一份报告里同一个"范围一排放"指标,正文表格给出一个总量,附录里按业务板块拆分出几个分项,两组数字看起来都对,加总起来却对不上——这不是报告写错了,而是分项口径和总量口径本身就存在细微差别(比如总量包含了某个已出售业务板块的historical数据,分项统计里已经剔除)。AI如果只抓其中一处,得到的会是一个片面的数字,看不出这背后其实有两套并不完全一致的统计范围。

提取:抓到数字只是开始,不是结束

提取环节,AI要从非结构化的文本、表格甚至扫描图片里,把数字、单位、指标名称、报告期间这几项一起抓出来,而不是只抓一个孤立的数字。举例来说,"2024财年,公司范围二排放(市场基准)为8,600吨CO2e"这句话里,至少包含五个要素:数值8,600、单位吨CO2e、指标类型范围二、核算方法市场基准、时间范围2024财年。只抓数字漏掉后面的限定词,是最常见的提取错误来源。有的报告財年不是自然年(比如4月至次年3月),提取时如果不记录清楚,后续汇总会把不同财年的数据错误地对齐到同一个日历年份里。

指标匹配:名字相近,不代表指的是同一件事

提取出来的原始字段,还要匹配到统一的指标体系里才能用于对比和汇总。这一步最容易出问题的地方,是名称相似但含义不同的指标被当成了同一个东西。比如"范围三类别1采购商品与服务排放"和"范围三总排放",前者只是范围三里的一个子类别,后者是全部十五个类别的合计,如果匹配错误,一个只占整体一小部分的数字会被当成总量使用,差距可能是几倍甚至十几倍。类似地,范围二排放本身就有"地区基准"和"市场基准"两种核算结果,两者对同一家企业可能差异很大,如果报告没有明确标注用的是哪一种,AI匹配时就必须把这个不确定性标记出来,而不是随便选一个填进去,这类相近指标之间的语义混淆,在处理篇幅长、条款密集的ESG报告时尤其容易发生,这也是ESG数据标准化工作里最费时间的一部分。

单位校验:吨、千克、兆瓦时,换算错一位就是灾难

单位校验是整条流水线里最容易被忽视、却最容易出大问题的环节。常见的单位混淆包括:质量单位(吨/千克/磅)、能耗单位(千瓦时/兆瓦时/吉焦)、排放单位(tCO2e和kgCO2e)。一个供应商如果把能耗从千瓦时误写成兆瓦时,数字上只差了一个前缀,但实际相差一千倍,如果这个数字未经核对直接进入汇总表,后续基于它计算的排放强度、单位产品碳足迹都会失真。单位校验要做的,是把提取出来的每一个数值和它声明的单位放在一起,和该指标的合理数值区间做比对——如果一家中型工厂全年电力消耗被提取成"120,000,000度",这个量级本身就值得先打回去核实,而不是直接采信。另一类容易被忽略的问题出现在跨语言、跨制式的报告里——有的供应商报告用逗号做千位分隔符,有的用小数点做千位分隔符,"1.200"在一种制式里是"1200",在另一种制式里却是"1.2",如果提取时套用了错误的数字解析规则,一个原本是四位数的数值会被读成个位数,或者反过来被放大一千倍,这类错误往往不会触发任何格式报错,因为解析出来的仍然是一个合法数字,只有和历史数据或者行业区间做比对,才能发现这个数字明显不合常理。

验证:口径、边界、时间范围三项对齐

单位对了,不代表数据就能直接使用,还要看核算边界。GHG Protocol允许企业按股权比例、财务控制权或运营控制权三种方式界定组织边界,同样一套实体资产,用不同的边界规则计算出的排放范围可能完全不同,这不是谁算错了,而是方法选择不同。验证环节要检查:这份报告披露的边界规则是什么、和企业库里已有的历史数据是不是同一种规则、财年起止日期是否一致、是否包含了新收购或已剥离的子公司。如果这几项没有对齐,同一家企业不同年份的数据放在一起做趋势分析,得出的"排放上升"或"排放下降"结论可能只是核算口径变化造成的假象,而不是真实的业务变化。举个具体情形:一家企业去年按运营控制权口径披露排放,今年因为股权结构调整改用财务控制权口径,两年的绝对数字放在一张趋势图里,哪怕业务规模完全没变,数字也可能出现大幅波动,如果验证环节没有把"口径已切换"这个信息标注出来,看报告的人很容易误以为这是真实的减排成果或者排放失控,这类因口径切换造成的假象,在跨年度汇总里比想象中更常见,也更难靠肉眼一眼看穿。

人工判断:校验不通过的数据,需要人来拍板

把以上几步走完,AI能做的是标出"这条数据单位存疑""这条数据边界和去年不一致""这条数据口径未标注,默认按地区基准处理是否合理"这类问题清单,但要不要采用某个数字、要不要联系供应商重新确认、要不要在报告里加注说明,这些判断需要有ESG专业背景或者法律合规经验的人来做决定。AI提取和校验解决的是效率问题——原本需要人工逐页核对几十份报告的工作,现在可以先由AI筛出大部分明显没问题的数据,把真正存疑的部分集中呈现出来;但AI不掌握企业内部的真实业务背景,也不能对报告的最终准确性承担责任,这也是为什么类似壹号国际这样的平台,会把单位和口径校验作为提取环节之后的独立步骤,而不是把"提取完成"直接等同于"数据可用",和后续针对供应商ESG数据做的异常排查一样,最终都需要人工环节来收尾。