AI附上来源,不代表事实已经得到证明。SEO团队需要把文章拆分为最小可核验主张,分别判断来源真实性、可靠性和证据支持程度,并通过主张台账、来源分级、日期版本管理、风险门禁、人工审核和发布后纠错,建立可以追溯到原始证据的内容生产体系。
AI可以在几分钟内完成过去需要数小时的信息检索、资料整理和内容初稿,但它也制造了一种更难识别的风险:
一篇文章看起来资料丰富、引用完整,并不代表其中的事实已经得到证明。
AI可能引用一个真实存在的页面,却错误理解原文;可能找到权威机构的网站,却引用已经过期的版本;可能把企业自身声明写成独立验证,也可能把官方事实、数据观察、行业观点和作者推断混合在同一段文字中。
对于SEO从业者,这类错误尤其危险。
搜索引擎文档、排名系统公告、结构化数据要求、抓取与索引规则、Search Console功能、AI搜索变化和技术SEO配置,都具有较强的时间敏感性与执行风险。一项未经核实的结论,可能进一步导致:
- 对外发布不存在的搜索更新;
- 把行业传闻写成官方规则;
- 错误修改Robots、Canonical或重定向;
- 误判网站流量下降原因;
- 将过期技术要求写入客户方案;
- 让错误信息被多个页面和工作流继续复制。
因此,SEO团队不能只要求AI“附上来源”,还需要建立一套完整的:
- 主张分类制度;
- 来源分级制度;
- 证据匹配规则;
- 引用证据链;
- 日期与版本管理;
- 冲突处理机制;
- 人工审核标准;
- 发布后纠错流程。
事实核验的目标不是让每句话后面都出现链接,而是让每一项重要主张都能返回真正支持它的原始证据。
一、为什么“让AI附上引用”仍然不够
AI引用错误并不只表现为虚构链接。更常见、也更难发现的问题,是来源真实存在,却没有真正证明正文结论。
常见情况包括:
- 来源存在,但正文结论不在原文中;
- 来源只支持部分内容,正文却扩大了结论;
- 引用的是新闻转述,而不是原始公告;
- 来源发布时间与实际事件日期被混淆;
- 页面已经更新,AI仍在使用旧版本内容;
- 企业自身声明被写成第三方独立结论;
- 多个网站相互转述同一个未经核实的说法;
- 引用位置距离主张过远,无法确认对应关系;
- 搜索摘要被当作完整原文;
- 来源支持事实共现,却不支持进一步的因果解释。
因此,引用核验至少需要完成三个相互独立的判断。
| 核验层级 | 需要回答的问题 | 典型错误 |
|---|---|---|
| 来源真实性 | 网页、文件、公告、数据或记录是否真实存在? | 链接虚构、页面不存在、标题与页面不符 |
| 来源适格性 | 该来源是否有资格证明当前主张? | 用广告产品文档证明自然搜索规则 |
| 证据支持度 | 来源中的具体内容是否真正支持正文结论? | 原文写“正在测试”,正文写“已经全面上线” |
有来源、来源权威、来源支持结论,是三个不同问题。
二、事实错误不能只靠更强模型解决
NIST发布的生成式AI风险管理资料,将生成式AI风险视为需要在设计、部署、测量和持续管理中处理的问题,而不是只在输出发生错误后再补救。
OpenAI关于语言模型幻觉机制的研究进一步指出,部分传统评测方式会奖励猜测而不是承认不确定性。当模型在“不回答”和“猜一个答案”之间只能通过猜测获得分数时,系统会形成过度回答的倾向。
这意味着,降低事实错误不能只依靠更换模型,还要改变整个工作流:
- 允许模型明确表示不知道;
- 要求模型区分事实、声明和推断;
- 要求关键主张指向具体证据;
- 找不到证据时撤回或降低结论强度;
- 高风险内容必须经过人工原文核验;
- 评测体系不能只奖励“回答完整”。
一个语言流畅、结构完整、从不承认信息不足的系统,未必比一个能够及时停止并转交人工的系统更可靠。
三、先统一五个基础概念
1. 主张
主张是内容中可以被证明、反驳或核验的具体陈述。
例如:
Google在某日修改了Review Snippet结构化数据文档。
这是可以核验的事实主张。
而下面的表述:
这项修改可能表明Google正在提高评价透明度要求。
属于分析或推断,不能按照相同方式标记为已确认事实。
2. 来源
来源是承载信息的网页、文件、数据库、公告、研究、访谈、视频、日志或其他记录。
来源本身只是信息载体,不自动等于可靠证据。
3. 证据
证据是来源中真正能够支持某项主张的具体部分,例如:
- 官方公告中的明确句子;
- 文档中的资格要求;
- 研究表格中的具体数值;
- 视频中的原始发言与时间戳;
- Search Console中的查询数据;
- 服务器日志中的抓取记录;
- GitHub提交中的代码变化。
4. 引用
引用是在最终内容中建立主张与来源之间的可见连接。
它的功能不是装饰页面,而是帮助审核人员和读者快速找到支持当前陈述的证据。
5. 来源追溯信息
来源追溯信息,也可以称为来源谱系或Provenance,用于记录某项信息:
- 从哪里产生;
- 由谁产生;
- 在什么时候产生;
- 经过哪些处理;
- 被什么工具使用;
- 最终形成了哪个版本。
W3C的PROV-O使用实体、活动和责任主体等关系表达来源追溯信息。SEO团队不一定需要完整部署语义模型,但可以借鉴其基本逻辑:
最终结论应能够追溯到原始资料、处理过程、所用模型和最终审核人员。
四、必须同时建立两条不同的链
很多企业把来源追溯和事实核验混为一谈。
实际上,二者解决的是不同问题。
| 链路 | 主要回答的问题 | 不能自动证明的内容 |
|---|---|---|
| 来源追溯链 | 内容由谁、何时、使用什么资料和工具产生? | 内容中的结论是否真实 |
| 事实证据链 | 具体主张依据什么证据成立? | 文件是否被篡改、生成过程是否完整 |
C2PA的Content Credentials可以记录数字内容的来源、处理过程和签名信息,帮助验证内容来源并发现部分篡改风险。
但由此不能进一步推导出:带有完整来源凭证的文字、图片或视频,其附带说明和所有观点一定正确。
同样,一份拥有完整版本记录的SEO报告,也可能因为数据筛选错误而得出错误结论。
来源追溯解决“这项内容是怎样产生的”,事实核验解决“这项结论为什么成立”。
五、建立七类主张状态
AI不应把所有输出都写成确定事实。建议为重要主张设置以下状态。
| 主张状态 | 定义 | 推荐表达 |
|---|---|---|
| 已核实事实 | 存在直接、有效且足以支持陈述的证据 | 官方记录显示、文档明确规定 |
| 有出处的主体声明 | 某机构或个人确实作出声明,但尚未独立验证 | 该公司表示、官方测试称 |
| 数据观察 | 来自特定样本、数据集或测量结果的现象 | 在本次样本中观察到 |
| 有证据支持的推断 | 证据支持合理解释,但不能直接证明结论 | 可能表明、可合理推断 |
| 待验证假设 | 证据暂时不足,但值得继续测试 | 可能与……有关,尚需验证 |
| 专业判断或建议 | 基于经验、风险和业务目标提出的行动建议 | 本文建议、在该场景下可优先 |
| 未确认或存在冲突 | 证据不足,或可靠来源之间存在实质分歧 | 截至目前尚不能确认 |
主张状态不是文章排版标签,而是控制语言强度和发布权限的内部规则。
当证据不足时,正确动作不是把句子写得更有说服力,而是降低结论等级或暂缓发布。
六、建立面向SEO任务的六级来源体系
一级:直接官方或第一手系统记录
包括:
- 搜索引擎正式文档和状态页面;
- 法律法规原文;
- 标准组织正式规范;
- 企业自己的Search Console、GA4和服务器日志;
- 产品官方API文档;
- 官方财务报告和监管文件。
一级来源通常最适合确认公开规则、事件时间、系统状态和本企业数据。
二级:原始研究、数据和完整记录
包括:
- 同行评审论文;
- 研究机构原始报告;
- 公开数据集;
- 完整实验记录;
- 会议完整视频或文字记录;
- 原始访谈;
- GitHub原始提交;
- 网站版本和变更记录。
三级:高质量专业媒体和研究分析
包括具有编辑审核机制、能够链接原始出处并说明采访或研究方法的专业媒体和咨询报告。
这类来源适合发现事件、补充背景和呈现行业反应,但不能替代搜索引擎官方规则确认。
四级:具名专家和一线从业者观察
包括:
- 有明确身份和专业记录的从业者;
- 公开案例研究;
- 真实数据截图;
- 技术实验;
- 会议演讲;
- 对官方资料的专业解释。
这类内容具有实践价值,但通常只能证明个案观察或专业观点。
五级:社区讨论和用户生成内容
包括论坛、社交平台、用户评论、群组记录和匿名线索。
这类来源可以用于发现问题、收集案例和形成研究假设,但不适合单独支持高风险结论。
六级:聚合内容和AI生成内容
包括:
- 没有原始出处的新闻聚合页;
- 自动摘要站;
- AI搜索回答;
- AI生成文章;
- 不链接原文的转载内容;
- 批量采集网站。
AI输出可以帮助发现线索,但AI输出本身不是事实来源。
七、来源权威性是一种关系,而不是固定标签
来源等级不能只看网站知名度或域名权威。
同一个来源,在不同主张中可能具有不同证据地位。
例如:
- 某模型公司公告,对于“该公司是否发布了某项功能”属于直接来源;
- 同一公告对于“该模型是市场上最准确的模型”只是企业自身声明;
- 某SEO专家的Search Console截图,可以证明其网站出现了流量变化;
- 同一截图不能单独证明Google已经实施全球性算法更新;
- Google官方文档适合确认Google公开规则;
- 它不能单独证明某项策略在所有网站上都会产生相同效果。
审核人员不应只问“这个网站权威吗”,而应问“它是否有资格证明当前这项具体主张”。
八、来源评估的七个维度
| 评估维度 | 需要检查的问题 |
|---|---|
| 身份真实性 | 能否确认发布主体、作者或责任机构? |
| 信息接近度 | 来源是原始发布者、直接观察者还是多次转载? |
| 时间有效性 | 内容是否仍适用于当前版本、地区和日期? |
| 专业适配度 | 发布者是否具备判断当前问题的能力? |
| 独立性 | 来源是否独立于被评价对象? |
| 可复核性 | 审核人员能否打开原文、数据或实验过程? |
| 上下文完整性 | 是否保留限定条件、否定语和完整语境? |
这些维度不必机械合并成一个总分。
更重要的是发现结构性缺陷。例如:
- 官方来源可能接近事件,但缺乏独立性;
- 研究报告可能专业度高,但数据已经过期;
- 社交帖子可能非常及时,却难以复核;
- 高质量媒体可能解释准确,但仍然只是转述。
九、核验单位不是文章,也不是段落,而是最小主张
事实核验失败的常见原因,是一次审核一整个段落。
例如:
Google更新了某项结构化数据文档,这意味着网站必须立即修改代码,否则会影响排名和AI搜索曝光。
这段话实际包含四项不同主张:
- Google修改了文档;
- 文档要求网站修改结构化数据;
- 不修改会影响普通搜索排名;
- 不修改会影响AI搜索曝光。
一份官方更新日志可能只支持第一项;文档正文可能支持第二项;第三项和第四项则可能没有任何证据。
最小主张应尽量满足:
- 只有一个主要主体;
- 只有一个核心动作或判断;
- 具有明确时间范围;
- 具有清楚适用范围;
- 能够被独立验证。
引用越多不代表证据越强。只有主张被正确拆分,来源与结论才能准确对应。
十、建立企业主张台账
主张台账是引用证据链的核心。
| 字段 | 说明 |
|---|---|
| Claim ID | 主张唯一编号 |
| 文章或任务ID | 主张所属内容或工作流 |
| 主张原文 | 准备发布的具体陈述 |
| 主张状态 | 事实、声明、观察、推断、假设或建议 |
| 风险级别 | 低、中或高 |
| 主体 | Google、网站、模型、产品或其他对象 |
| 时间范围 | 主张适用的日期或周期 |
| 地区范围 | 全球、特定国家或特定市场 |
| 来源等级 | 一级至六级 |
| 原始链接或文件ID | 证据所在位置 |
| 发布日期 | 来源首次发布的日期 |
| 事件日期 | 实际事件发生或生效日期 |
| 最后更新时间 | 来源最近修改日期 |
| 访问日期 | 审核人员查看原文的时间 |
| 证据片段 | 真正支持主张的段落或数据 |
| 证据位置 | 页码、段落、表格编号或时间戳 |
| 支持关系 | 完全支持、部分支持、冲突或不支持 |
| 限定条件 | 原文中的适用边界 |
| 核验人 | 完成人工审核的人员 |
| 核验状态 | 通过、修改、待确认或禁止发布 |
| 复查日期 | 动态事实下次重新核验时间 |
主张台账的价值,在于防止文章经过修改后,引用仍然停留在原位置,却不再支持新的正文结论。
十一、引用证据链的标准结构
一条完整的证据链至少包含以下节点:
最终主张 → 主张状态 → 证据片段 → 原始来源 → 核验过程 → 审核责任人
成熟系统还可以继续记录:
模型版本 → 提示词版本 → 检索时间 → 工具调用 → 草稿版本 → 发布版本 → 后续更正
当内容发生争议时,企业应当能够回答:
- AI最初生成了什么;
- 使用了哪些来源;
- 哪个证据支持哪一项主张;
- 谁完成了最终审核;
- 哪个版本被正式发布;
- 错误发生在哪一个环节;
- 是否还有其他内容受到相同错误影响。
十二、证据与主张必须完成三重匹配
1. 主体匹配
来源讨论的对象必须与正文对象相同。
Google Ads的产品规则,不能直接用于证明Google自然搜索的处理规则。
2. 命题匹配
来源必须真正支持正文中的动作和判断。
- “正在测试”不能写成“已经全面上线”;
- “可以使用”不能写成“必须使用”;
- “可能影响”不能写成“必然导致”;
- “官方表示”不能写成“已经独立证实”。
3. 范围匹配
来源中的时间、地区、产品、用户和场景范围必须与正文一致。
“部分美国用户可用”不能被改写为“全球用户均已开放”。
只有主体、命题和范围全部匹配,来源才能被认定为完全支持主张。
十三、定义四种证据支持关系
| 支持关系 | 判断标准 | 处理方式 |
|---|---|---|
| 完全支持 | 来源直接证明主张,且没有遗漏重要条件 | 可以进入发布流程 |
| 部分支持 | 来源只支持部分内容,或正文语气强于原文 | 缩小结论、增加限定或补充证据 |
| 存在冲突 | 来源与正文相反,或可靠来源彼此不一致 | 暂停确定结论并处理冲突 |
| 不支持 | 来源与主题相关,但不能证明该句话 | 删除引用或撤回主张 |
相关不等于支持。
这是AI引用中最常见、也最容易被忽视的问题。
十四、发布日期、事件日期和版本日期必须分开
SEO资讯通常同时存在多个日期:
- 官方公告发布日期;
- 文档首次发布日期;
- 文档最后修改日期;
- 功能开始上线日期;
- 排名更新开始日期;
- 排名更新结束日期;
- 媒体报道日期;
- 审核人员访问日期。
一篇行业媒体在7月10日发布报道,不代表功能在7月10日上线;官方文档在7月12日修改,也不自动代表政策从7月12日开始生效。
对于动态来源,主张台账应分别记录:
{
"official_publish_date": null,
"document_update_date": null,
"effective_date": null,
"system_start_time": null,
"system_end_time": null,
"media_report_date": null,
"verification_date": null
}
没有对应日期时应保留为空,不得用一个日期替代全部时间概念。
十五、搜索结果摘要不能作为最终证据
搜索摘要可能:
- 截断原文;
- 拼接多个段落;
- 保留旧缓存;
- 忽略否定词;
- 删除适用条件;
- 与当前页面内容不一致。
发现搜索结果后,审核人员仍需要打开原始页面,检查:
- 页面主体和发布者;
- 标题;
- 正文上下文;
- 发布日期与更新时间;
- 适用范围;
- 关键结论是否仍然存在;
- 是否有后续修正。
对于PDF、图表、视频或图片资料,还应查看对应页码、图表、图注或时间戳,不能只依赖自动提取的文字。
十六、不要机械执行“双来源规则”
“每项事实都必须有两个来源”看起来严格,但并不总是合理。
单一直接来源可以成立的情况
- 来源就是事件主体;
- 主张只描述该主体的公开行为或声明;
- 原文清楚且没有重大争议;
- 正文保留了准确归属;
- 不存在明显商业效果外推。
需要独立交叉验证的情况
- 来源存在明显商业利益;
- 主张涉及效果、优越性或市场地位;
- 结论可能影响重大业务决策;
- 来源内容存在争议;
- 需要从个案推广到普遍规律;
- 多个可靠来源出现冲突;
- 事件适用范围不清楚。
交叉验证的目的不是增加链接数量,而是减少单一来源偏差。
十七、多个网站重复报道,不等于多源确认
如果十篇文章都转述同一条社交平台消息,它们本质上仍然只有一个信息源。
判断来源是否独立,需要追踪:
- 消息最初从哪里出现;
- 后续报道是否自行核验;
- 是否采访了不同主体;
- 是否使用不同数据;
- 是否只是互相引用;
- 是否来自同一份新闻稿。
循环引用通常表现为:
- 网站A引用网站B;
- 网站B引用网站C;
- 网站C最终引用网站A;
- 没有任何一方提供原始证据。
看到多个相似链接时,审核人员应继续追问:这条信息最初从哪里产生?
无法找到原始出处时,应降低主张等级,而不是用更多转载链接制造“多源证实”的表象。
十八、处理来源冲突的标准流程
当两个可靠来源出现冲突时,不应让AI通过多数投票决定事实。
- 比较主张:确认双方讨论的是否真是同一对象和问题。
- 比较时间:后发布来源是否包含修正或更新信息。
- 比较范围:是否分别适用于不同地区、产品或版本。
- 比较接近度:谁更接近原始事件或原始数据。
- 比较方法:研究样本、指标和计算方法是否不同。
- 保留冲突:无法解决时,不发布确定结论。
正确表达可以是:
目前公开来源之间存在不一致,尚不能得出确定结论。
文章的完整性不应建立在强行消除真实不确定性的基础上。
十九、事实共现、因果关系和数字必须分别核验
因果关系
AI容易把两个同时发生的现象写成因果关系。
例如:
网站流量下降发生在Google更新期间,因此下降是该更新造成的。
这句话至少包含:
- 流量确实下降;
- 更新确实发生;
- 二者时间重合;
- 更新造成了下降。
前三项可以核验,第四项属于因果推断,还需要排除:
- 网站技术变化;
- 季节性需求;
- 跟踪代码异常;
- 页面删除或迁移;
- 竞争对手变化;
- 品牌搜索需求变化;
- 搜索结果展示结构变化。
数字与比例
数字主张至少应记录:
- 原始数据;
- 样本量;
- 分母;
- 时间范围;
- 筛选条件;
- 计算公式;
- 四舍五入规则;
- 能否复现。
例如,“首次合格率提高20%”必须明确是:
- 从50%提高到70%,即提高20个百分点;
- 还是从50%提高到60%,即相对提高20%。
百分比和百分点不能混用。
二十、直接引用与概括引用应分开管理
直接引用
逐字使用原文时,应:
- 保持原意;
- 保留必要上下文;
- 标记具体出处;
- 控制引用长度;
- 避免不必要的大段复制。
概括引用
用自己的语言总结原文时,应:
- 不扩大结论;
- 保留重要限定条件;
- 不把“可能”改成“确定”;
- 不把“部分用户”改成“所有用户”;
- 不把“相关”改成“导致”;
- 不把主体声明改成独立事实。
审核系统应同时保存:
- 原始证据文本;
- 准备发布的概括文本;
- 二者的对应关系。
二十一、引用必须靠近所支持的主张
在一个长段落末尾放置多个来源,容易让读者和审核人员无法判断:
- 哪个来源支持哪句话;
- 是否所有来源都支持整段;
- 哪些内容属于作者判断;
- 哪些结论超出了来源范围。
更合理的方式是:
- 在关键事实后立即引用;
- 一个引用不要承载多个不相关主张;
- 事实、推断和建议分段;
- 作者判断使用明确提示语;
- 高风险数字直接链接原始数据或研究。
例如:
Google官方文档新增了一项资格要求。
这句话需要官方来源。
本文判断,这项变化可能提高网站数据一致性的重要性。
第二句属于分析,不能让同一个官方引用看起来也证明了作者推断。
二十二、AI事实核验的标准生产流程
- 确定内容类型:区分新闻、技术指南、数据报告、产品内容和客户报告。
- 确定风险等级:标记低风险、中风险和高风险主张。
- 拆分最小主张:为需要核验的陈述分配Claim ID。
- 标记主张状态:区分事实、声明、观察、推断、假设和建议。
- 定义理想来源:先判断什么来源有资格证明当前主张。
- 从直接来源检索:优先查找官方资料、原始研究和内部数据。
- 打开原文:检查发布主体、日期、正文、版本和适用范围。
- 提取证据片段:保存具体段落、表格、页码或时间戳。
- 判断支持关系:标记完全支持、部分支持、冲突或不支持。
- 核验日期与版本:分别记录发布、更新、生效和访问日期。
- 执行必要交叉验证:对高风险和效果类结论寻找独立证据。
- 调整语言强度:根据证据使用已确认、官方表示、可能或尚未确认。
- 人工终审:由非生成者检查原文和关键结论。
- 保存证据链:保留主张台账、来源版本、模型和提示词记录。
- 设置复查日期:动态信息到期后重新核验。
二十三、建立生成、核验与人工审核三层结构
第一层:生成模型
负责:
- 整理资料;
- 提取候选事实;
- 生成初稿;
- 标记不确定内容;
- 提供候选来源。
第二层:核验模型或规则系统
负责:
- 拆分可核验主张;
- 检测缺少来源的数字;
- 比较正文与证据;
- 识别主体、时间和范围扩大;
- 检测过度确定的语言;
- 标记高风险内容。
第三层:人工审核
负责:
- 判断来源是否适格;
- 查看原始证据;
- 处理来源冲突;
- 判断因果关系;
- 审查业务和技术风险;
- 批准最终发布;
- 承担最终责任。
三层结构不是让多个模型互相投票,而是让不同层承担不同责任。
二十四、三类SEO内容需要专用核验标准
1. 搜索资讯与官方更新解读
至少需要区分:
- 正式排名系统更新;
- 官方文档修改;
- 产品功能变化;
- 界面测试;
- 广告产品变化;
- 未确认排名波动;
- 行业观点。
不能把以下内容包装成搜索算法更新:
- 广告或Merchant Center功能变化;
- 单个网站排名波动;
- 从业者社交平台截图;
- 旧文档被媒体重新报道;
- 没有官方确认的流量变化。
2. 技术SEO内容
涉及Robots、Canonical、Hreflang、重定向、JavaScript渲染、XML Sitemap、HTTP状态码或Schema代码时,应同时完成:
- 官方文档核验;
- 代码或语法检查;
- 测试环境验证;
- 适用范围判断;
- 回滚方案设计;
- 技术人员批准。
文章引用了正确文档,不代表AI生成的代码可以直接进入生产环境。
3. 数据分析内容
针对GSC、GA4或爬虫数据,应记录:
- 数据导出时间;
- 时区;
- 筛选条件;
- 比较周期;
- 页面和查询范围;
- 数据缺失;
- 指标定义;
- 异常处理方式。
AI不能只根据一张趋势图下结论,还应检查日期长度、季节性、跟踪变化、站点改版、品牌活动和其他混杂因素。
二十五、建立事实核验发布门禁
| 风险等级 | 典型内容 | 最低审核要求 |
|---|---|---|
| 低风险 | 一般背景说明、格式整理、非关键描述 | 自动检查、来源抽样、编辑确认 |
| 中风险 | 行业数据、SEO建议、竞争分析、内容策略 | 拆分关键主张、来源分级、人工审批 |
| 高风险 | 官方政策、算法更新、技术配置、客户数据、法律合规 | 全部进入台账、原始来源优先、逐条人工审核、禁止自动发布 |
以下问题可设置为一票否决:
- 关键来源无法打开或核验;
- 引用来源不存在;
- 来源与正文主张无关;
- 高风险主张没有证据;
- 把媒体报道写成官方确认;
- 把个人观察写成普遍事实;
- 数字无法说明来源和计算过程;
- 日期存在无法解释的冲突;
- 模型无法提供证据却继续下结论;
- 高风险网站修改没有专业审核;
- 来源包含未经授权的敏感数据;
- 存在明显循环引用。
二十六、引用证据链的核心质量指标
| 指标 | 计算或判断方式 |
|---|---|
| 可核验主张覆盖率 | 已完成核验的主张数 ÷ 全部需要核验的主张数 |
| 引用准确率 | 真正支持相邻主张的引用数 ÷ 全部引用数 |
| 高风险直接来源使用率 | 使用直接来源的高风险主张数 ÷ 全部高风险主张数 |
| 过期来源率 | 超过规定有效期的来源数 ÷ 全部来源数 |
| 不支持引用率 | 不支持正文的引用数 ÷ 全部引用数 |
| 高风险无证据率 | 缺少充分证据的高风险主张数 ÷ 全部高风险主张数 |
| 发布后更正率 | 因事实或引用问题被修改的内容数 ÷ 全部发布内容数 |
| 严重事实错误数 | 单独统计虚构更新、错误政策、伪造数据等事故 |
高风险无证据率在正式发布前应当为零。
严重事实错误不能被平均准确率掩盖,应单独记录和追责。
二十七、原创判断:企业真正需要管理的是“证据债务”
内容生产越快,未经核验的主张也可能积累得越快。
当企业持续发布:
- 无法找到原始出处的数字;
- 没有适用范围的技术结论;
- 缺少时间版本的规则说明;
- 来源只能支持一半的扩大性判断;
- 没有负责人维护的动态信息;
网站就会形成一种类似技术债务的证据债务。
证据债务不会总是在发布当天暴露,却会在以下场景中集中出现:
- 官方规则发生变化;
- 客户要求核验结论;
- 搜索流量出现异常;
- 不同文章相互矛盾;
- AI继续引用旧页面;
- 需要批量更新历史内容;
- 发生投诉或责任争议。
引用数量只能说明文章连接了多少页面,证据治理能力决定企业能否解释每一项重要结论为什么成立。
二十八、发布后必须建立更正与追溯流程
即使经过审核,仍可能出现来源更新、官方撤回、计算错误、链接失效或新证据推翻旧判断。
- 记录问题:保存发现时间、影响文章、问题类型和报告人。
- 判断严重程度:区分格式错误、部分事实错误和核心结论错误。
- 控制影响:必要时暂停传播、撤下内容或停止自动工作流。
- 修正文案与证据链:不能只改正文而保留错误引用。
- 保留更正记录:记录修改前后内容、原因、时间和审核人。
- 回查同类内容:检查使用相同提示词、来源库或数据生成的其他页面。
- 改进生产流程:将本次错误加入评测集和审核规则。
成熟制度追求的不是“永不出错”的口号,而是:
- 降低错误发生概率;
- 提高错误被发现的概率;
- 缩小错误影响范围;
- 保证错误可以追溯;
- 防止相同错误重复发生。
二十九、最低可行部署方案
尚未建立系统的SEO团队,可以先使用一份受控电子表格,设置四个工作表。
工作表一:文章与任务
记录文章名称、负责人、内容类型、风险等级、状态和发布日期。
工作表二:主张台账
记录重要主张、Claim ID、证据片段、支持关系和核验状态。
工作表三:来源库
记录来源名称、等级、日期、适用范围、原始出处和有效期。
工作表四:错误与更正
记录发现的问题、影响范围、处理方式和流程改进。
最低要求是:
- 高风险主张必须拥有Claim ID;
- 所有引用必须打开原文核验;
- 所有动态事实必须记录日期;
- 所有推断必须使用限定语;
- 发布前必须由非生成者审核;
- 发生错误后必须回查同类内容。
三十、成熟阶段可以部署自动化证据系统
当内容规模扩大后,可以进一步建设:
- 自动主张提取:识别草稿中所有可核验陈述;
- 来源检索路由:根据主张类型选择官方文档、研究论文或内部数据;
- 证据片段保存:记录具体段落、页码、表格或时间戳;
- 一致性检查:检测主体、时间、范围和确定性变化;
- 数字校验:检查单位、分母、计算公式和百分点;
- 风险路由:将高风险主张交给指定审核人员;
- 版本追溯:保存模型、提示词、来源和文章版本;
- 过期提醒:动态来源超过有效期后自动要求复查。
自动化系统可以提高覆盖率,但不能取消高风险事实的人工责任。
结语:真正可信的内容,可以沿着证据链返回原点
AI时代最容易制造的是“看起来像事实的文字”。
它可以使用专业术语、完整结构、精确数字和大量引用,让内容显得非常可靠。
但真正的专业标准不是文字看起来有多确定,而是每一项重要结论能否回答:
- 这句话属于事实、声明、观察还是推断?
- 谁最有资格证明这句话?
- 原始证据在哪里?
- 来源是否仍然有效?
- 原文是否真正支持该结论?
- 是否存在限定条件或冲突证据?
- 谁完成了最终核验?
- 出现错误后怎样修正和追溯?
引用不是事实核验的终点,而是证据链的入口。
SEO团队真正需要建立的,不是一份越来越长的“权威网站名单”,而是一套能够识别主张、判断来源、匹配证据、控制结论边界并明确发布责任的工作体系。
当一篇内容能够从最终结论,沿着引用、证据、来源、处理过程和审核记录返回原点时,它才真正具备可验证性。
可验证性,才是AI内容从“被生成”走向“被信任、被引用和被长期保留”的基础。
参考依据
- NIST:AI Risk Management Framework
- NIST:Generative Artificial Intelligence Profile
- OpenAI:Why language models hallucinate
- Anthropic:Citations documentation
- W3C:PROV-O, The PROV Ontology
- C2PA:Technical Specification 2.4
- Google Search Central:使用生成式AI内容的指南
- Google Search Central:创建实用、可靠且以用户为中心的内容
- Google Search Central:网页搜索垃圾内容政策