网站防AI爬虫的开关一开,搜索收录跟着没了,这事9月之后要当心

2026-09-30 05:44:48 2 次浏览
企业官网AI爬虫搜索引擎收录Cloudflare网站优化

做AI搜索优化这行八年了,最近帮客户检查网站的时候,接连碰到同一类问题:站长为了不让自家内容被AI拿去训练,把Cloudflare上的防AI爬虫开关打开,结果搜索引擎的收录也跟着掉了。9月15日之后,这个开关的连带影响比很多人想的大得多,建议先把站里的设置翻出来看一眼再说。

搜索爬虫被一起拦了,不算误伤

9月15日起,Cloudflare把Googlebot、Bingbot这类搜索爬虫划进了「搜索加AI训练双用途」的类目。意思是这些爬虫一边给搜索引擎抓页面,一边也在给AI训练供料。你站上原来那个「屏蔽AI爬虫」的设置,会把它们一并拦在门外。免费套餐和新开的站点默认就生效,想不被拦,得在截止时间前手动显式退出。

有个站长朋友跟我讲过他的经历。九月中旬他发现后台日志里Googlebot的抓取记录明显变少,谷歌站长工具里的收录曲线一路往下掉。起初他以为是服务器迁移出了岔子,在机房里翻了三天日志,最后才反应过来是那个开关的事。反馈类似情况的站长不止他一个,收录异常的截图在圈子里已经见了好几回。

后台日志里搜索爬虫的抓取记录断了档,收录曲线一路下滑

这里头的逻辑其实不难懂。平台把搜索爬虫和AI训练合并成一类,对平台来说是省了区分的成本,对站长来说就是一道二选一的题:要么放行,搜索收录保住,内容也顺带进了AI的训练池;要么拦下,训练是挡住了,搜索流量也一起没了。以前不存在这道题,九月之后每个开站的都得选一回。

拦之前,先分清谁是谁

很多站长配置拦截规则图省事,凡是带bot字样的全挡。这就容易误伤。我把常见的几类理了理,放在下面这张表里。

爬虫类型 代表 干什么用 放行建议
传统搜索爬虫 Googlebot、Bingbot 搜索收录 别拦,拦了收录就断
搜索加AI双用途爬虫 同上,9月15日后被归为一类 搜索收录加AI训练 按平台设置权衡,想保搜索要显式退出
AI训练爬虫 各家AI公司的抓取程序 专门给大模型供料 不想被训练可以拦
苹果生态爬虫 Applebot 苹果搜索与AI内容来源 慎拦,拦了苹果的AI也用不了你的内容

把搜索爬虫、双用途爬虫、AI训练爬虫和苹果爬虫分开对待

表的用意不是替谁说话,而是提醒一句:规则粒度越粗,误伤面越大。真要拦,也该挑着拦。配置完别急着关页面,隔两天再回头看一眼日志,确认该放行的爬虫抓取正常,这一步很多人干脆就省了,出问题都是几周后才从流量数据里看出来,折腾的是自己。

就算进了AI索引,开头没写重点也白搭

海外有研究机构拆解过ChatGPT的自有索引,结论挺有意思:不管网站跟OpenAI有没有内容合作协议,页面都可能被收进索引。索引里主要保留的是页面标题和开头两百个字符左右的文本,导航、模板这些头部内容会被当成页面元信息处理。

说白了,AI能记住你的页面,基本就靠开头那一小段。要是开头堆的是欢迎语、面包屑导航或者一堆宣传套话,核心内容全压在中间和结尾,那在AI眼里你这页面等于没说什么事。我看过一家做工业设备的企业官网,首页开头是一整屏的轮播图加导航条,正文第一段压根没提主营产品,这种站就算被收录了也白费劲。

改法不复杂。把每篇内容的前两百字当成独立摘要来写,标题下第一段就把人、事、结论交代清楚,别铺垫。这一条对搜索引擎摘要同样管用,属于一举两得的活。

苹果这边有个新入口,也有条红线

iOS 27的Siri会给AI生成的回答,这对有实体门店和品牌官网的人是个新机会。想有机会被Siri引用,得去Apple Business Connect把商家信息认领了、填完整,再核对Apple Maps上的展示信息对不对,名称地址电话都要对得上。

反方向也有个坑。有的站长安全策略一刀切,把日志里所有爬虫全挡了,Applebot也顺带被拦。等于自己把苹果生态这扇门焊死了,等Siri开始给AI回答的时候,你的内容根本不在候选池里。

之前碰过一个做本地家政服务的客户,门店信息在Apple Maps上还挂着两年前的旧地址,客户按地图导航找过去扑了个空,投诉直接打到店里。这种基础信息没核对的,别说AI引用了,普通用户都留不住。趁着这次检查,把认领和核对一起干了反而省事。

这几天就能做的五件事

  • 登录Cloudflare后台,看一眼防AI爬虫设置的当前状态,免费套餐和新站默认生效,想保搜索流量必须在设置里显式退出
  • 翻服务器日志,核对最近两周Googlebot和Bingbot有没有被403或者人机验证拦下,有的话赶紧处理
  • 把重点页面的开头两百字重写一遍,核心信息、主营内容放进第一段,导航和模板文字往后挪
  • 有实体业务的去Apple Business Connect认领商家信息,顺便把Apple Maps的展示核对一遍
  • 检查防火墙和CDN的拦截规则,别把搜索爬虫和苹果的爬虫混在一起一刀切

打开设置页,先确认防AI爬虫开关的当前状态

开关是站长的权利,想保护内容完全可以理解。只是拨之前得知道它连带切掉了什么,9月15日已经过去,查得越晚,收录恢复得越慢。你的站最近有没有碰到类似情况,评论区聊聊。

🤖
本内容由 AI 辅助生成,经人工校对审核;部分素材、资料来源于公开网络,仅作个人观点分享与交流使用,无任何商业侵权意图。若内容、图片、文字涉及您的合法著作权、版权权益,请联系本人,核实后将第一时间删除、修改相关内容。