Cloudflare 这次 AI 爬虫新规改变了什么?
Cloudflare 7 月 1 日宣布:从 2026 年 9 月 15 日起,新客户、新站点以及未主动修改设置的现有免费客户,其含广告页面将默认允许搜索用途,但阻止训练和 Agent 用途;无法把搜索、训练与 Agent 分开的“混合用途”爬虫,也会在含广告页面上被默认阻止。站长仍可在仪表盘中修改规则。
这不是“互联网全面封锁 AI”,而是一次用途拆分。过去站长常被迫在“保持搜索可见”与“允许内容被其他用途使用”之间二选一。新分类试图把这两个问题拆开。
为什么内容出海团队现在要检查爬虫策略?
Cloudflare 公布的网络数据称,2026 年 6 月,52% 的爬虫请求用于 AI 训练,高于 2025 年春季的 22%;混合用途爬虫占活动量超过 36%。这组数据来自 Cloudflare 自身网络,不能代表每一个网站,但足以说明默认放行策略需要重新审视。
更现实的问题是投入产出。大量抓取未必带来相同比例的人类访问、订阅或成交。Cloudflare 还称,超过 50% 的 AI 爬取流量是在重复获取没有变化的页面,这会消耗站点带宽和 AI 公司的计算资源。
出海网站应该如何决定封、放还是收费?
第一步:先测量哪些机器人在抓取?
至少记录四组数据:爬虫运营方、用途分类、抓取量与带宽、抓取后带来的人类引荐。Cloudflare 新的 Attribution Business Insights 提供 crawl-to-referral ratio,并把爬虫区分为 Training、Search 和 Agent。
小站也可以从 CDN 日志、服务器日志、Search Console 和分析工具开始。没有测量就直接全封,可能同时丢掉发现机会。
第二步:按内容价值分层可以怎么做?
| 内容类型 | 建议起点 | 主要原因 |
|---|---|---|
| 产品页、公开文档、品牌介绍 | 允许搜索与合规发现 | 目标是被找到并产生转化 |
| 原创研究、付费报告、数据库 | 限制训练,评估授权或付费 | 复制成本低,生产成本高 |
| 广告驱动文章 | 观察引荐后再决定 | 无点击消费会削弱广告模式 |
| 会员内容、客户数据 | 默认保护 | 涉及合同、隐私与访问权限 |
第三步:不要把 robots.txt 当成唯一控制层?
robots.txt 仍有价值,但站长还应检查 CDN、WAF、Bot Management 和应用层规则。最终生效的是整条访问链路,而不是单个文件。修改后应从外部重新测试目标页面是否可访问,并确认没有误伤搜索索引。
第四步:每 30 天复盘什么指标?
复盘抓取量、引荐访问、转化、带宽、内容被引用次数和误封情况。对联盟营销或 SaaS 网站,最终指标不是“爬虫越少越好”,而是高价值发现与可控内容使用之间的平衡。
Pay Per Crawl 和 Pay Per Use 能成为新收入吗?
可以观察,但不应计入确定收入。Cloudflare 正把 Pay Per Crawl 扩展到 Pay Per Use:Ceramic.ai 试验在内容进入 AI 搜索结果时向参与的发布者付费,You.com 则试验让 Agent 按需购买特定优质内容。
Cloudflare 自己明确称这些方案仍是实验。对大多数独立站来说,当前优先级应是建立原创、可归因的内容资产,再评估授权条款,而不是给每个页面随意标价并期待自动收入。
Cloudflare 新规会不会伤害 SEO 与 GEO?
风险取决于配置。若把合法搜索爬虫与训练爬虫一起阻止,传统搜索和 AI 搜索的发现能力都可能下降。因此需要按用途和运营方检查,而不是只看“AI Bot”总标签。
Google 6 月 29 日更新的官方指南强调,生成式 AI 搜索仍依赖基础 SEO:原创且有用的内容、清晰技术结构、可抓取文本、合适图片与良好页面体验。Google 也表示,为 Google Search 添加 llms.txt 或特殊 AI 标记并不会提高排名。对 DOG出海笔记这类内容站,GEO/AEO 的重点应是可验证经验、清楚答案与引用监测,而不是追逐单一文件或格式。
9 月 15 日前应该完成哪些动作?
- 导出最近 30 天 Bot、Search 与引荐数据;
- 标记公开、授权、会员和敏感内容;
- 分开 Search、Training 与 Agent 的访问规则;
- 对产品页和帮助文档做外部可抓取测试;
- 为原创研究保留发布时间、作者、更新记录和引用证据;
- 建立每月 crawl-to-referral 与转化复盘;
- 把 Pay Per Use 当试验项目,而不是收入承诺。
FAQ
Cloudflare 会在 9 月 15 日阻止所有 AI 爬虫吗?
不会。公告针对含广告页面的新默认设置,重点阻止训练、Agent 和不能拆分用途的混合爬虫;客户可以在仪表盘修改设置。
小型独立站应该立即屏蔽 GPTBot 等爬虫吗?
不应只凭名称立即全封。先确认爬虫用途、访问量、引荐与内容敏感度,再做分层规则。会员和客户数据应优先保护,公开产品信息则通常需要发现能力。
Pay Per Use 已经可以稳定赚钱吗?
不能这样承诺。Cloudflare 与 Ceramic.ai、You.com 的合作仍是早期试验,规模、定价和结算效果都需要继续验证。
做 GEO 必须添加 llms.txt 吗?
至少对 Google Search 不是必须。Google 官方指南明确表示,llms.txt 不会帮助或损害其搜索可见性。是否为其他服务维护该文件,应按实际支持情况决定。
如何避免屏蔽 AI 爬虫时误伤 SEO?
把搜索、训练和 Agent 用途分开配置;修改 CDN 或 WAF 后,从外部测试页面、检查服务器日志,并持续观察 Search Console 的抓取与索引变化。
参考资料
- Cloudflare:Your Content, Your Rules(2026-07-01)
- Cloudflare:Content Independence Day 一周年
- Cloudflare:Attribution Business Insights
- Cloudflare:Making AI Search Smarter
- TechCrunch:Cloudflare 新政策与发布者内容付费
- Google Search Central:生成式 AI 搜索优化指南
最后更新时间:2026 年 7 月 2 日 19:05(Asia/Shanghai)
DOG出海笔记持续更新 AI 工具、GEO/SEO、跨境电商和内容出海的可验证变化与实操方法。
评论
发表评论