ESG数据进入大模型后,企业该如何守住信息真实性
ESG数据进入大模型后,企业该如何守住信息真实性
企业把ESG表格、供应商文件和会议记录交给大模型,希望它快速生成分析。然而这些材料可能互相冲突:一份表按自然年统计,一份按财年统计;某供应商填写估算值,另一家提交实测值。模型若忽略差异,就会把不一致整理成语气坚定的结论。信息真实性首先取决于输入数据如何治理。
企业应为每条关键数据保存来源、单位、期间、边界、采集人和批准状态。模型可以阅读数据,但不能改变原始记录;转换单位或合并口径时要留下计算过程。对于旧版数据被修订的情况,应保留版本关系,避免模型引用一半旧值、一半新值。数据目录比漂亮的提问界面更基础。
一项可操作的实验,是让模型回答十类真实ESG问题,并故意在资料库放入重复文件、过期指标和相互矛盾的表格。记录它是否引用最新授权版本,能否提示冲突,是否在缺证时拒绝给出确定数字。评估标准应包括证据匹配率、错误传播率和人工复核耗时。
权限也是事实治理的一部分。供应商数据可能只允许汇总使用,员工反馈可能包含个人身份。检索系统需在查询前执行权限检查,而不是让模型读完之后再试图删除敏感内容。输出给外部的结论应只使用获准披露的证据,同时保留内部可审计的引用链。
提示词可以要求模型“只根据给定材料回答”,但单靠一句规则挡不住错误。更可靠的是结构化校验:数值从受控表格读取、单位由程序检查、文本主张逐条链接来源,无法通过校验的句子暂不进入报告。模型负责语言整理,事实边界由数据系统约束。
当数据冲突时,系统应把争议交给责任部门,而不是替企业选择更好看的数字。对外发布后若发现错误,也应记录更正时间与原因。透明修订未必让报告显得完美,却比无声改写更能建立信任。
模型生成结论前,可以先自动输出一张“证据卡”:主张、使用的原始字段、转换方法、版本和仍存在的疑点。审阅者在同一界面就能核对依据,而不必翻找多个系统。证据卡若不能生成,相关句子就不进入正式报告。
特别需要防止资料库被旧模板污染。上一年度的正确数字,在新年度可能已经过时;一个公开演示用的样本表,也不能误入正式检索。文件应有“草稿、获批、作废”状态,并在模型调用前过滤。真实性是整个信息链条的属性,不是最后一轮校对能补救的。
一个实用指标是“可复核率”:审计人员随机抽取模型生成的环境结论,有多少能在限定时间内找到完整来源。若报告很快写完,复核却耗费数周,效率只是被转移。企业应把复核成本一起纳入AI项目评价。
大模型让ESG信息流转更快,真实信息被扩散得更快,错误也一样。企业守住真实性的方式,是让每个重要数字都能回到有权限、有版本、有口径的原始记录,并让不确定性留在可见的位置。