测试1

AI 爬虫不能再白嫖了?Cloudflare 正在改写开放互联网规则

AI 爬虫不能再白嫖了?Cloudflare 正在改写开放互联网规则

AI 爬虫开始“分流收费”:开放互联网正在进入新规则时代

如果说过去二十年的互联网默认规则是“内容被搜索引擎抓取,然后搜索引擎给网站带来流量”,那么生成式 AI 时代正在把这套规则重新打碎。

今天最值得关注的一件事,是 Cloudflare 对 AI 爬虫管理规则的进一步升级。Cloudflare 在 2026 年 7 月 1 日宣布,网站所有者现在可以按照 AI 爬虫的实际用途来分别管理访问权限:Search、Agent、Training。简单理解,Search 是搜索索引用的爬虫,Agent 是代表用户实时访问网页的智能体,Training 则是拿内容去训练或微调模型的爬虫。Cloudflare 文档明确提到,即使是免费套餐用户,也可以按这三类行为分别控制 AI 爬虫。

这件事看起来像是一个网站安全功能更新,但它背后其实是互联网内容生态的一次重大变化:AI 公司还能不能像过去搜索引擎那样,默认抓取整个互联网?

搜索引擎时代的“默契”正在失效

传统搜索引擎抓取网页,网站通常是欢迎的。因为搜索引擎虽然读取了内容,但它会把用户带回原网站。站长获得访问量,媒体获得广告曝光,博客作者获得读者,这是一种相对平衡的交换。

但生成式 AI 改变了这个交换关系。

AI 模型或 AI 搜索产品抓取内容后,很多时候并不是把用户送回原网页,而是直接在对话框里生成答案。用户不再点进网站,内容创作者也就拿不到访问量、广告收益或稳定的曝光。Cloudflare 在介绍 Content Signals Policy 时也提到,过去内容被抓取通常还能换来引用、流量或某种归因,但现在被抓取的内容有时会反过来和原创者竞争。

这就是矛盾的核心:AI 需要高质量内容,但高质量内容的生产者不一定能从 AI 中受益。

Cloudflare 的新规则:不是一刀切,而是分场景控制

这次 Cloudflare 的重点不是简单地“封杀 AI 爬虫”,而是把 AI 爬虫拆成了三类。

第一类是 Search,也就是搜索索引。它的作用更接近传统搜索引擎,理论上应该给网站带来回流。

第二类是 Agent,也就是 AI 智能体访问网页。比如用户让 AI 帮忙查资料、比价、总结网页,背后可能就是 Agent 在实时读取网页内容。

第三类是 Training,也就是用于训练或微调模型的数据抓取。这一类对内容创作者最敏感,因为它可能不会带来任何直接流量,却会把原创内容变成模型能力的一部分。

从 2026 年 9 月 15 日开始,Cloudflare 会给新接入的域名设置新的默认规则:在展示广告的页面上,Training 和 Agent 类型的爬虫会默认被阻止,而 Search 会默认允许。Cloudflare 还特别提到,多用途爬虫如果同时承担 Search 和 Training 行为,也会受到这些更严格规则影响。

这个设计很有意思。它不是简单说“AI 爬虫都不行”,而是开始区分:你是来帮我分发内容的,还是来拿我的内容训练模型的?

“按次付费抓取”可能会成为新商业模式

Cloudflare 之前还推出过 Pay Per Crawl,也就是“按次付费抓取”的实验。它给网站所有者提供三种选择:允许爬虫免费访问、要求爬虫付费访问,或者直接阻止访问。技术上,Cloudflare 会使用 HTTP 402 Payment Required 这样的机制,让爬虫知道某个资源需要付费后才能访问。

这意味着未来的网页可能不再只有“公开”和“私有”两种状态,而是多了一层新的商业关系:人类读者可以正常访问,搜索引擎可以索引,但 AI 训练爬虫需要付费。

这对大型媒体、问答社区、专业数据库来说尤其重要。因为它们拥有大量高质量内容,如果这些内容长期被免费抓取,而访问量又被 AI 摘要分流,原有商业模式就会受到冲击。

但这件事对个人博客也有启发。

以前个人博客更多关注 SEO:怎么让搜索引擎收录,怎么让文章排到前面。现在可能还要多考虑一层:我的内容是否允许被 AI 用于训练?是否允许 AI Agent 实时抓取?是否希望通过 AI 搜索获得曝光?

个人博客应该怎么应对?

对个人博客来说,我觉得没有必要立刻走向极端。完全禁止 AI 爬虫,可能会错过未来 AI 搜索带来的新流量;完全开放所有内容,又可能让自己的原创内容被无成本吸收。

更现实的做法是分层处理。

对于普通技术笔记、教程、经验总结,可以允许搜索引擎和部分 AI 搜索访问,因为这些内容本来就适合传播,能带来长期曝光。

对于高价值原创内容,比如深度研究、独家经验、系统方案、付费资料,则可以更谨慎地设置 robots.txt、Content Signal 或 Cloudflare 的 AI Bot 管理策略。

对于个人博客站长来说,后面值得关注的不是“要不要被 AI 抓取”,而是“哪些内容可以被谁、以什么方式使用”。

这也是互联网从 Web2 走向 AI 时代后,一个很重要的变化:内容不再只是给人看的,也会被机器读取、理解、压缩、再分发。

开放互联网会不会变得更封闭?

这件事也有争议。

支持者会认为,这是对内容创作者的保护。AI 公司不能只享受开放互联网的红利,却不回馈内容生产者。如果没有合理补偿,长期来看,高质量内容会减少,互联网会被低成本 AI 内容填满。

反对者可能会担心,如果越来越多网站对 AI 爬虫收费或封锁,开放互联网会进一步碎片化。大公司可以付费买数据,小公司和开源模型反而更难获得训练资源,最终可能让 AI 行业更加集中。

所以,这件事不是简单的“Cloudflare 封杀 AI 爬虫”,而是一个更大的问题:AI 时代的互联网,应该如何重新分配内容、流量和收益?

我的判断

我认为,AI 爬虫收费和分流管理会成为未来几年的大趋势。

原因很简单:AI 对内容的需求不会减少,内容创作者对权益的诉求也不会消失。过去的 robots.txt 更多是一种君子协议,而现在,网站所有者正在需要更强的技术控制、更清晰的使用声明,以及更现实的商业补偿。

对普通用户来说,这可能暂时感知不强。但对站长、媒体、开发者和内容创作者来说,互联网的底层规则已经开始变化。

以前我们做网站,重点是“如何让人看到”。

以后我们做网站,还要多问一句:我的内容,是否也正在被 AI 看见?如果是,它应该付出什么?

评论

0

友善交流,理性表达

正在加载评论…