多家大型出版商正在重新计算向Google开放内容的收益,部分公司甚至把限制Google抓取纳入讨论。但“拒绝部分Gemini训练”“限制Google搜索中的AI摘要”和“退出Google自然搜索”是三种不同选择。没有分清Googlebot、Google-Extended与摘要控制指令,原本只想限制AI使用,最终可能先切断仍有价值的搜索入口。
大型出版商为什么开始讨论屏蔽Google
《华尔街日报》于2026年7月22日报道,USA Today、Politico、Reuters、The Economist、People Inc.及Reddit等内容平台,正在重新评估与Google之间的内容、流量和商业交换。Search Engine Roundtable在7月23日的跟进报道中整理了多家公司管理人员的公开说法。
不同公司的态度并不相同。Politico内部讨论过限制机器人访问部分免费文章;Reuters表示正在权衡搜索流量与AI摘要的经济取舍;People Inc.称完全屏蔽已进入讨论范围;The Economist则明确表示,退出Google并非当前讨论内容。Reddit被报道正在评估是否继续允许Google将其内容用于AI。
这些是媒体报道和企业谈判选项,不是上述网站已经集体屏蔽Google的证据,也不是Google发布的新抓取政策。
争议背后的核心问题是价值交换:外部点击持续下降时,内容仍可能被用于搜索摘要、模型训练或其他AI产品,出版商是否还能获得足够回报。关于“AI搜索整体发送大量点击,但单个网站仍可能下降”的数据边界,可参阅Google AI搜索点击与网站流量变化分析。
先看结论:五种目标对应五种控制
| 网站目标 | 主要控制方式 | 对Google Search的影响 |
|---|---|---|
| 保留自然搜索,只限制部分Gemini训练与grounding | Google-Extended |
不影响搜索收录,也不是排名信号 |
| 限制整个页面的文字摘要与AI搜索直接输入 | nosnippet或max-snippet |
会同时改变传统搜索摘要和AI搜索资格 |
| 只排除页面中的特定文本 | data-nosnippet |
页面仍可收录,指定文本不用于摘要 |
| 让页面退出Google搜索 | noindex并允许重新抓取 |
传统结果与AI搜索机会一并失去 |
| 阻止Google抓取整个网站 | 屏蔽Googlebot |
相当于退出Google搜索体系的主要入口 |
如果内容本身不应公开访问,以上任何爬虫或摘要指令都不够。应使用登录验证、服务器权限或密码保护。
第一层:屏蔽Googlebot意味着退出Google搜索体系
Googlebot是Google Search使用的主要爬虫。如果在robots.txt中加入全站禁止规则:
User-agent: Googlebot
Disallow: /
Googlebot将无法继续抓取网站正文。Google官方说明,针对Googlebot的抓取偏好会影响Google Search及其所有搜索功能,并涉及Google Images、Google Video、Google News和Discover等产品。
因此,屏蔽Googlebot不是单独拒绝AI训练,而是放弃传统自然结果、搜索中的AI功能及多个搜索分发入口。
已经收录的URL不一定立即消失。Google在无法重新抓取页面时,仍可能依据外部链接等信号暂时保留URL,但无法正常读取页面指令或生成完整摘要。如果目标是从结果中删除页面,应允许Googlebot访问并读取noindex;如果目标是保密,则应限制真实访问权限。
robots.txt主要用于管理抓取流量,不是保密机制,也不是可靠的索引删除工具。
第二层:Google-Extended限制部分AI用途,但不影响自然搜索
网站希望保留Google Search,却限制Google定义的部分Gemini训练与grounding用途,可以评估以下规则:
User-agent: Google-Extended
Disallow: /
Google把Google-Extended定义为独立产品令牌,用于控制已抓取内容是否可被用于训练未来版本的Gemini模型,以及Gemini Apps和Vertex AI相关产品中的部分grounding用途。Google同时明确表示:Google-Extended不影响网站进入Google Search,也不是Google搜索排名信号。
它有两个容易误解的边界:
- Google-Extended没有独立的HTTP User-Agent。日志中通常不会出现一个持续以“Google-Extended”名称访问的机器人;它是Google读取并执行的
robots.txt产品令牌。 - 屏蔽Google-Extended不能让页面退出AI Overviews或AI Mode。Google把这些功能视为Search的一部分,其抓取仍由Googlebot管理,内容展示还受摘要指令控制。
换句话说,Google-Extended解决的是Google其他部分AI系统中的训练与grounding选择,不是Google Search AI的一键退出按钮。
第三层:限制AI搜索引用,需要管理摘要权限
Google官方说明,要限制Search中的AI功能从页面展示或直接使用多少信息,应使用nosnippet、max-snippet、data-nosnippet或noindex。这些指令同时作用于传统搜索展示,不能只看“AI”一侧。
nosnippet不是低风险的AI退出开关
<meta name="robots" content="nosnippet">
nosnippet会阻止页面显示文字摘要和视频预览,适用于网页搜索、Google Images、Discover、AI Overviews和AI Mode,也会阻止页面内容成为AI Overviews与AI Mode的直接输入。
副作用同样明确:Google要求页面已收录且具备显示摘要的资格,才有资格作为AI Overviews或AI Mode的支持链接。全页启用nosnippet可能同时削弱传统搜索点击表现和AI搜索中的链接资格。依赖自然搜索的网站,不应在没有分组测试和回滚方案时全站启用。
max-snippet限制使用量,也会改变传统摘要
<meta name="robots" content="max-snippet:160">
该指令限定Google最多使用多少字符生成文字摘要,并同时限制AI Overviews和AI Mode中的直接内容输入。max-snippet:0等同于nosnippet,max-snippet:-1表示由Google决定合适长度。
摘要越短不代表点击一定越多。过短的摘要可能无法说明页面价值,反而降低传统结果的点击率。若网站通过结构化数据、数据源或许可协议另行提供内容,这类更具体的授权也可能不受普通摘要限制完全覆盖。
data-nosnippet适合排除特定段落
<p>这段文字可以用于搜索摘要。</p>
<div data-nosnippet>
这部分文字不应被用于生成摘要。
</div>
Google支持把data-nosnippet添加到div、span和section元素。它适合排除会员内容中的特定段落、容易脱离上下文的免责声明、动态提示或重复模板文本,而不必关闭整页摘要。
但它不是安全措施,正文仍公开存在。放在该区域内的结构化数据仍可能用于搜索结果;如果不希望某项结构化数据被使用,需要同步修改对应字段。
noindex解决的是搜索收录
<meta name="robots" content="noindex">
Google重新抓取并处理后,会把页面排除在搜索结果之外,传统自然搜索、AI Overviews和AI Mode中的机会一并失去。它适合账户页、表单确认页、无独立价值的内部搜索页等不应公开参与搜索的页面。
不要同时在robots.txt中屏蔽该URL,否则Googlebot可能无法读取页面里的noindex。
WordPress网站最容易出现的四类配置错误
把“阻止AI”插件当成统一开关
不同插件对“AI爬虫”的定义不同:有的只写入Google-Extended,有的同时屏蔽Googlebot,还有的使用长期未更新的爬虫列表。启用前应检查它实际生成的规则,而不是只看按钮名称。
动态robots.txt、实体文件与CDN缓存互相覆盖
WordPress可以动态输出/robots.txt,服务器根目录也可能存在实体文件,CDN与安全插件还可能缓存旧版本。修改后应直接访问公开URL并清理相关缓存,确认最终响应与后台设置一致。
主题和SEO插件重复输出robots标签
一处允许摘要、另一处设置nosnippet时,Google通常采用更严格的规则。查看源代码并搜索name="robots"与name="googlebot",确认只有预期指令。
只检查HTML页面,忽略PDF和下载文件
HTML页面可使用robots meta标签,PDF、图纸和其他非HTML文件通常需要通过HTTP响应头中的X-Robots-Tag控制。产品规格、检测报告与技术资料应单独确定收录和访问策略。
这些重复输出、规则来源不明和缓存不一致,本身也是一种需要长期治理的技术债务。可结合SEO技术债务的分级管理方法建立规则所有权与复查机制。
企业网站应该怎样选择控制层级
大多数通用B2B、制造业、工业设备、工程设备和零售电商网站,都不适合直接屏蔽Googlebot。这些网站依赖Google帮助潜在客户发现产品、规格、解决方案、案例、配送和售后信息。退出Google所损失的不只是博客访问,还包括品牌搜索、图片搜索和高商业意图长尾查询。
| 内容类型 | 主要价值 | 建议起点 |
|---|---|---|
| 公开文章与指南 | 品牌发现、教育与引用 | 默认保留Search可见度,按段落评估摘要控制 |
| 产品、方案、案例 | 比较、采购与询盘 | 优先保护收录、摘要和图片可见度 |
| 会员或许可内容 | 订阅与授权 | 明确公开摘要范围,核心内容使用登录权限 |
| 内部或机密资料 | 非公开使用 | 服务器权限或身份验证,不依赖robots.txt |
大型出版商可以把完全屏蔽作为商业谈判筹码;普通企业网站首先要计算的是搜索发现、品牌曝光和询盘价值是否仍然高于开放成本。
实施前后怎样验证,避免误伤流量
- 明确目标:区分训练、grounding、搜索摘要、索引和访问权限,不使用含糊的“屏蔽AI”表述。
- 划分页面:把搜索发现型、商业决策型、受限内容和机密内容分开。
- 保存基线:记录变更日期、URL清单、Search Console展示与点击、转化、日志和现有AI引用。
- 小范围测试:先在同类型的低风险页面中实施,不直接改全站规则。
- 检查公开输出:核对
robots.txt、源代码、HTTP响应头、CDN缓存及PDF。 - 等待重新抓取:摘要与索引指令要等Google重新抓取和处理,不会在保存后立即完全呈现。
- 设置回滚条件:若AI引用下降的同时,高价值页面点击、图片曝光或询盘明显受损,应重新评估。
监测时至少区分品牌词与非品牌词、文章页与商业页、HTML与下载文件,以及访问量与实际转化。不能只用“AI引用是否减少”判断政策是否成功。
风险与适用边界
- 出版商的商业模式与普通企业网站不同,不能把媒体流量困境直接复制为所有网站的爬虫策略。
- Google-Extended只管理Google定义的相关产品,其他搜索引擎和AI服务有各自的令牌与规则。
robots.txt依赖爬虫自愿遵守,无法保护敏感、付费或专有信息。- 摘要控制会同时改变传统搜索展示,必须把点击率和AI使用放在同一实验中评估。
- 本文解释的是技术控制边界,不构成版权、许可或反垄断法律意见。
原创判断:网站需要的不是“AI开关”,而是内容使用政策
“是否屏蔽AI”把多个问题压缩成了一道错误的选择题。网站真正面对的是:内容能否被抓取,页面能否被收录,正文能否生成摘要,信息能否进入搜索AI答案,以及内容能否用于其他模型训练。
这些问题分属不同控制层。成熟做法不是在情绪压力下全站封锁,也不是默认无限开放,而是根据页面价值、商业目标与可接受用途制定分层政策:公开内容承担发现和引用,高商业意图页面保护搜索可见度,专有内容限制摘要或要求登录,真正机密的信息不出现在公开URL。
先定义允许什么、拒绝什么,再选择对应的技术指令;否则一次看似保护内容的设置,可能先切断网站仍然有价值的搜索入口。
原始来源与核验
- The Wall Street Journal:Google Was a Lifeline for Publishers
- Search Engine Roundtable:大型出版商考虑屏蔽Google
- Google:AI搜索功能与网站控制
- Google:Googlebot、Google-Extended及其他常用爬虫
- Google:robots meta、data-nosnippet与X-Robots-Tag
- Google:robots.txt的用途与限制
- Google Search Status Dashboard
核验截至北京时间2026年7月24日06:00。出版商动向来自《华尔街日报》调查与Search Engine Roundtable跟进,属于企业讨论和媒体观察;Googlebot、Google-Extended与摘要控制的作用范围使用Google官方文档核验。本文讨论内容访问与搜索展示控制,不是排名算法更新。