一份两百页的英文ESG年报,AI几分钟就能读完并列出几十个数据点,这种效率提升是真的。但报告里"renewable electricity"和"renewable energy"这两个看起来几乎一样的词,指的可能是完全不同范围的能源统计,如果分析师没有意识到这一点,直接把两个数字放进同一张对比表,结论从一开始就是错的。

AI读得快,但报告本身写得并不规整

企业ESG报告通常不是按统一模板写成的,同一家公司不同年份的报告结构可能都不一样,更不用说不同公司之间。有的企业把能源数据放在"环境绩效"章节的表格里,有的放在附注里用文字描述,还有的分散在不同小节,同一个指标可能在报告正文出现一次、在附录的详细数据表里又出现一次,两处数字如果统计口径不完全一致,人工阅读时容易被忽略,AI在批量处理时如果没有专门做去重和交叉核对,也可能把两个版本的数字都当作有效数据抓取出来,造成同一份报告里出现"自相矛盾"的两个结果。

报告里的语言表述也经常模糊不清。比如"我们的可再生能源占比持续提升"这类句子,本身没有给出具体数字,如果AI模型在没有约束的情况下被要求"提取可再生能源占比",有一定概率会把上下文中出现的其他相关数字(比如目标年份的规划数字,而不是当期实际数字)误当作答案抽取出来。这类错误不是模型"编造"数据,而是文本本身的歧义被放大了,说明拿到AI提取结果后,回到原文核对上下文仍然是必要步骤。

还有一类常见问题出在图表。很多企业习惯把关键数据放进柱状图或折线图里,正文反而只用文字概括趋势,不重复列出具体数字。这种情况下,模型如果只处理文字层面的内容,会直接漏掉图表里的原始数据;即便模型具备读图能力,图例、坐标轴单位、数据标签的位置千差万别,读取误差的概率也会明显高于读取表格文字。有的报告甚至把同一个指标在正文用一种单位表述、在图表坐标轴上用另一种单位呈现,比如正文写"万吨"、图表纵轴标注"千吨",这类细节如果不被专门检查,很容易在跨文档汇总时出现数量级偏差。

此外,不同企业选择披露的年份区间也不统一,有的企业只披露最近一年数据,有的会追溯披露过去三到五年的历史数字并不断调整口径。如果分析师想做跨年度趋势比较,还需要先确认每一年的数字是否用的是同一套统计边界,企业在报告里因方法学改进而下修历史数据的情况并不罕见,如果不加注意,直接把新旧口径的数字连成一条趋势线,得出的"变化"可能只是核算方法调整的结果,而不是真实的业务变化。

看起来接近的指标名称,口径可能完全不同

ESG报告里最容易出问题的地方,是名称相近但定义不同的指标。举一个典型的例子:"renewable electricity"通常特指电力消费中来自可再生来源的比例,而"renewable energy"是更宽泛的概念,可能涵盖供热、燃料等电力以外的能源形式,两者的分母和分子都不一样,如果不加区分地放在一起比较,得出"这家企业可再生能源比例更高"这样的结论,很可能是不成立的。类似的例子还包括"Scope 3 category 1"(通常指采购商品和服务产生的排放)和"Scope 3总量",前者只是Scope 3七大类别之一,如果把它当成Scope 3全部排放来引用,会明显低估企业实际的供应链排放规模;再比如前文提到的市场基础法和地域基础法两种Scope 2核算结果,如果报告没有清楚标注用的是哪一种,两家企业的数字放在一起比较同样会产生误导。

这类问题之所以容易被忽略,是因为它需要读者对行业标准术语有相当程度的了解,才能意识到两个名称相似的指标背后其实是两套完全不同的统计口径。普通业务人员甚至部分财务或采购人员,未必天然具备这层专业知识,而AI模型如果只是从字面语义上判断"这两个词看起来意思差不多",同样可能把它们错误地归并到一起处理。

类似的容易混淆的指标对,在ESG报告里还有不少:企业范围内的能耗总量和分子公司披露的能耗数据,往往因为并表口径不同而不能直接相加或对比;员工总数有的企业按全职折算人数统计,有的按实际在册人数统计,两者在计算人均排放或人均能耗这类指标时会得出不同结果;供应商覆盖率有的企业指的是按采购金额加权的比例,有的指的是按供应商数量计算的比例,同样一句"我们已覆盖80%的供应商",背后的分母选择不同,实际含义可能差异很大。这些指标名称在中文翻译后往往变得更接近,进一步增加了混淆的可能性,需要指标字典在中英文对照层面也做出清楚区分。

指标字典和规则,是AI避免张冠李戴的关键前提

要让AI在处理长文档时不把不同口径的指标混为一谈,前提是先有一份足够细致的指标字典,把每一个常见指标的标准名称、同义表述、统计范围、常见单位、容易混淆的相邻指标都提前定义清楚。比如字典里需要明确标注:"renewable electricity"和"renewable energy"是两个不同字段,抽取时要分别归类,不能互相替代;"Scope 3 category 1"到"category 15"是子类别,只有全部子类别加总才能称为Scope 3总量;市场基础法和地域基础法的Scope 2数字要分别标记字段名,不能合并成一个"排放量"字段。有了这份字典,模型在抽取时可以先做初步分类,再用规则引擎做二次校验——比如检测到某个数字被标注为"总量"但数值明显小于同类企业的子类别平均值,就应该被标记为可疑,触发人工复核,而不是直接采信。

规则校验还包括单位和量纲的一致性检查:吨和千吨、公吨和短吨、按年计算和按月计算,这些差异如果没有被规则捕捉到,会导致数量级完全错误的结果混入最终报告。一个常见的规则设计思路是:给每个指标预设一个合理数值区间,超出区间的抽取结果自动标红,交给人工判断这是企业本身的异常情况,还是抽取环节出了单位换算错误。

建立这样一份指标字典本身也是一项需要持续维护的工作,而不是一次性做完就能长期使用。国际主流披露框架本身也在不断调整——比如欧盟层面的强制披露标准正在推进简化,部分行业专属指标被合并进更通用的指标体系;一些国际标准制定机构也在讨论把不同的产品碳足迹计算标准逐步统一。这意味着指标字典需要有人定期跟踪框架变化,及时更新指标定义和适用范围,如果字典本身滞后于最新的披露要求,即便模型严格按字典执行,输出结果也会跟不上企业实际需要遵循的最新口径。

模型给出的是候选答案,不是最终结论

比较务实的工作流程,是把AI模型的角色定位为"生成候选答案"而不是"给出最终结论"。模型读完长文档后,为每个指标标注出它认为对应的数值、所在页码、上下文原文片段,分析师拿到的不只是一个孤立的数字,而是数字加上可以回溯核对的原文出处。这样即便模型判断有误,人工复核时也能快速定位到原文,判断问题出在文本歧义、单位换算,还是模型本身理解错了指标定义。相比之下,如果模型直接输出一张干净的汇总表却不保留原文出处,表面上看起来更"成品",但一旦某个数字有问题,倒查原因的成本会高很多。

学术界近两年专门评估长文档场景下大模型处理ESG报告的可靠性,相关基准测试显示,模型在处理篇幅较长、专业术语密集的可持续发展报告时,确实存在编造不存在的指标或治理条款的风险,这类风险在文档越长、术语越密集的情况下越明显,这也是为什么"输出加原文出处"这种可追溯的设计,比单纯追求输出速度更重要。

还有一种被学术界和实践机构都认可的缓解方式,是让模型在遇到无法确定的数据点时明确回答"未提供"或"无法确认",而不是为了给出一个看起来完整的答案而强行填一个数字。这种做法听起来会让最终产出的表格出现更多空白,短期内看起来没有"读得全"那么好看,但对于ESG数据这种需要经得起客户和审核方追问的场景,一个诚实标注为空的字段,远比一个看似完整实则来源不明的数字更有价值——至少企业知道这里需要人工再补一次数据,而不是把一个错误的数字当成既定事实用在了对外披露里。

真实发生过的教训:AI生成内容里的虚构引用

数字和引用类内容的AI幻觉问题,并不只是学术讨论。2025到2026年期间,已经有多家国际知名咨询机构被曝出旗下AI辅助生成的报告存在虚构引用或编造数据的问题,例如某家机构提交的报告被发现四十多个引用里只有个别指向真实存在的来源,另一家机构的报告被发现引用了并不存在的研究,还因此对客户做出部分退款处理。这些事件发生在专业服务机构、有审核流程的场景下,仍然出现了问题,说明即便是经验丰富的团队,也不能假设AI生成的数字和引用天然可信,必须建立独立的核验环节。对于ESG报告这种数字密集、监管关注度高的文档类型,这一点尤其需要被认真对待。

这些案例的共同点在于,问题往往不是在生成环节被发现,而是在报告交付之后,被客户、监管方或者第三方核查人员追溯引用来源时才暴露出来。等到那个阶段再去补救,企业需要承担的不只是重新核实数据的成本,还包括对外披露信誉受损、合同纠纷甚至部分退款的实际代价。这也说明,把人工核验环节放在报告对外发布之前,而不是等出了问题之后再补救,是控制这类风险成本最低的方式。

人工判断留在哪里,边界要划清楚

AI在ESG指标处理链条里能够胜任的工作,包括阅读长篇报告、按预设字典提取候选数据、匹配相近指标之间的异同、识别单位和口径差异、标记数值异常、辅助整理供应商资料、生成报告初稿供人工修改。但有几类判断必须留给人工:报告里数据本身是否真实准确,这依赖企业实际的原始记录和审计,AI没有能力核实;某个指标该按哪种边界或哪种核算方法统计,涉及企业自身业务结构判断,需要熟悉具体业务的人来决定;最终报告能不能对外发布、是否符合监管要求,这类合规责任判断,需要专业人员而不是模型来承担;跨年度、跨企业的比较是否有意义,也需要人工先确认统计口径是否真正一致,而不是看到两个数字接近就直接下结论。壹号国际AI大模型在ESG数据处理场景里扮演的角色,正是把前面这类可以自动化的环节做得更快更准,而不是取代企业和专业人员在关键节点上的判断和责任。