官网要不要屏蔽AI爬虫?开放抓取和授权收录两条路怎么选

2026-10-08 09:09:51 1 次浏览
企业官网AI爬虫robots协议AI搜索收录方案对比

先说结论。我是老周,做网站和AI搜索优化八年了,我的看法是:官网要不要屏蔽AI爬虫,从来不是一道对错题。你得先分清两件事,抓你内容去训练模型,和抓你内容去回答用户提问,用途不一样。一刀切封掉,往往连搜索可见性一起丢了。这事儿真正的解法,是分层给。

屏蔽这件事,九月之后能分层做了

以前聊官网屏蔽AI爬虫,语境很单一,无非给还是不给。到了九月,工具层面开始出现分层。9月15日,Cloudflare 上线了两样东西:一个是「禁止 AI 训练、但保留搜索可见」的站点设置,另一个是所谓「可问责(Accountable)爬虫」认证,苹果、谷歌、微软被列为首批(据其官方博客)。

白板上把训练抓取和检索抓取分成两层来讨论

同一时期还有报道提到,谷歌在给「内容被 AI 引用」的出版商试算付费,还处于早期试点(据媒体报道)。这两件事放一块看,信号挺清楚:平台方开始把训练用途和检索用途拆开处理了。

对站长来说,这个变化挺实在。你手里的闸门从一个变成了一排,能按爬虫的用途分别放行。说白了,以前是关闸和开闸两个动作,现在多了「只关训练这一层」的选项。谁先摸清自家站点到底被哪些爬虫抓,谁的规则就配得省事。

四条路摆在桌上,一条条看

我把常见的做法归成四条路,列在下面这张表里,对号入座就行。

路线 适合谁 代价是什么 能观测到什么 什么时候该换
全开放,默认放行所有抓取 靠曝光吃饭、内容还没形成独家料的站 内容被各家拿去训练,出了问题没法追责 日志里各类爬虫都在正常抓取 出现内容被成批搬运、自家流量被分流时
只屏蔽训练,保留检索 既要搜索流量,又不愿白送训练语料的站 规则粒度细,得按爬虫分别写 搜索类爬虫照常抓,训练类被挡在外 平台侧分类变了或爬虫标识变了,老规则失效时
全屏蔽,一刀切 内容高度敏感、不靠自然搜索获客的站 搜索可见性一起掉,AI 回答里再也查不到你 日志里搜索爬虫也断了档 发现自然搜索流量腰斩、收录直线下滑时
白名单授权,只放行指定爬虫 内容有独家价值、需要留可追责记录的站 要维护名单,名单外的新爬虫一律进不来 只有名单内的爬虫有抓取记录,可回溯 合作方或自家收录需求变了,名单得重排时

这张表不替你拍板,只把代价摊开。真要选,我多半在第二条和第四条之间来回调,看站的性质定。要是拿不准,先用第二条试水,观察两周的收录数据,再决定要不要收紧到第四条,省得来回折腾。

先翻日志,再动手

配规则之前,有件事值得先花半小时。我那台常年开着的电脑上,有个固定动作,每天早上先扫一眼服务器抓取日志和流量曲线,看看最近两天都是谁在敲门、敲的是哪些目录。有回帮一家做工业配件的官网看日志,头两屏全是训练类爬虫的抓取记录,搜索类爬虫反而稀稀拉拉。这种情况你要是直接全挡,等于把本来就没多少的搜索入口也堵死了。

服务器抓取日志贴在白板上,圈出检索类与训练类爬虫

那这事该按什么顺序做?我一般照下面几步走,不花钱,但能省很多返工。

  • 翻服务器抓取日志,先分清楚来的是哪一类爬虫,是检索用途还是训练用途,别只看名字里带不带 bot
  • 分清 UA 和实际用途,同一家的程序可能标识相近但用途不同,照名字一刀切容易误伤
  • 先在测试目录里试规则,确认该放行的能进来、该挡的真被挡住,再挪到正式站
  • 回头看一眼搜索引擎后台的收录数据,收录没掉再往下走,掉头了就先查规则
  • 要按目录分层的,把公开页、产品页和内部资料页分开设,别用一套规则管全站

顺带提一句,规则改完别就不管了。我习惯设个提醒,隔两周回来看一次日志,确认该进来的还在进、该挡的还挡着。平台侧的爬虫标识不是一成不变的,改天一变,原先配好的规则可能就白配了。

会议室里先把话吵清楚

规则是技术活,但方案该由谁来拍,往往得几个人坐下来。前阵子我陪一个客户开了场会,一屋子人围着白板,运营想保搜索流量,法务担心内容被白拿,技术只关心规则会不会误伤。白板上左边一列写放开的好处,右边一列写收紧的好处,吵了一上午,落点却只有一句:训练那层收紧,检索那层留门。

会议室白板:放开与收紧各一列,方案当场定下来

会开完你会发现,方案选哪条,其实取决于自家靠什么活着。靠自然搜索带询盘的站,检索这层得留着;靠独家内容立身的站,训练这层该收紧。中间那部分,就靠白名单授权一点点调。

这类会我开过不少,最后卡住的地方常常不在技术,而在没人愿意拍板。我的建议是先挑最保守的一版上,跑上一周看数据,再谈要不要放松。规则改起来不难,难的是改之前想清楚要保什么、能舍什么。

收个口

回到开头那个问题,官网要不要屏蔽AI爬虫,答案落在用途上。检索抓取关系着你在搜索和 AI 回答里露不露脸,这层轻易别关;训练抓取关系着你的内容会不会被无偿喂给模型,这层看自家底气和内容价值。两条路并非只能选一条,多数站其实走在中间。

给两条能落地的建议。一条,这周就翻一遍服务器日志,把近一个月的抓取来源按用途归类,先摸清现状。另一条,去搜索引擎后台看一眼收录曲线,确认最近没有异常下滑,再决定要不要动规则。

你们站现在是怎么配的?有没有踩过误伤的坑?评论区聊聊。

🤖
本内容由 AI 辅助生成,经人工校对审核;部分素材、资料来源于公开网络,仅作个人观点分享与交流使用,无任何商业侵权意图。若内容、图片、文字涉及您的合法著作权、版权权益,请联系本人,核实后将第一时间删除、修改相关内容。