前几天我们给自己官网加了一层自动封禁——把恶意扫描的 IP 自动挡在门表。上线前留了一步:先只观察、不真封,把”若是开启会被封掉的 IP”记下来看几天。
了局这一步救了我们:观察期抓出的三十多个”该封”的 IP 里,有 4 个是真的 Googlebot。
若是其时图省事直接开启,我们就会把 Google 的爬虫挡在门表——并且没有任何器材会报警。网站照常打开,后盾所有正常,只有排名和收录会在接下来几周里慢慢往下走,等你发现时早就找不到原因了。
这件事值得单独写一篇,由于它是好多公司在犯却齐全不知路的错:装了安全插件、上了 CDN、配了防火墙规定——防护是加上了,但很可能顺手把搜索引擎和 AI 的爬虫也一路挡了。
先说结论:防护和 SEO 天生矛盾,由于好人坏人长得太像
你想挡的攻击者和你想请进来的搜索引擎爬虫,行为特点高度沉合:都是法式自动接见、都不看告白不点按钮、都在短功夫内抓大量页面、都来自你不意识的 IP。
所以任何”按接见频率封禁”的规定,必然同时误伤爬虫。这不是配置没调好,这是判据自身选错了。我们观察期里那 4 个 Googlebot,有一个用单个衔接陆续抓了 647 个页面——单看这个数字,和扫描器毫无区别。
一个险些没有灰色地带的判断特点:看”找不到”的比例
频率不能用,那用什么?我们试出来一个判据,分辨度大到险些不用犹豫:看这个访客要求的页面里,有几多是”底子不存在”的。
原因很直白:正常爬虫是顺着你给的线索抓的——站点地图里列了哪些网址、页面里有哪些链接,它就抓哪些,所以射中率极高。而扫描器是在猜——挨个试探有没有配置文件泄漏、有没罕见据库备份、后盾在哪,绝大无数当然是”找不到”。
实测这两类的差距大到没有中央地带:爬虫的”找不到”比例根基是 0,扫描器普遍在 87% 以上,好多是 100%。所以把”找不到的比例”作为封禁的前置前提,比单纯看频率靠谱得多。
一个反直觉的坑:域名里有 google,不代表是 Google
我们在观察期还抓到一个很有意思的器材:一个 IP 反查出来的域名带着 google 字样(属于 Google 云的一个子域),但它当使佚在探测qy千亿 /.git/config——这是典型的攻击行为。
原因是:那类域名属于云服务器的租户,谁都能花钱租一台,和 Google 自己的爬虫齐满是两回事。所以”域名里含 google 就放行”这种图省事的写法,会直接把真扫描器请进门。同理,只看访客自称的身份(UA)更不成靠——那玩意儿谁都能轻易填,假装成百度爬虫是最基础的手法。
正确的验证法子:双向解析对得上才算
业界的尺度做法叫正反解验证,搜索引擎官方文德凤都写着,分三步:
- ① 反查:拿访客 IP 反向解析出域名。
- ② 查对:看这个域名是不是搜索引擎的官方域名(好比百度、Google 各自颁布的爬虫域名)。要按”点”精确匹配后缀,不能用”蕴含”——不然
xxx-google.com这种域名也能混从前。 - ③ 正查:再把这个域名正向解析回 IP,和访客 IP 对得上,才确认是真的。
三步都过才放行。只做第一步不够,只看 UA 蹬宗没做。
另表一个我们踩过的细节:若是 DNS 自身出故障,反查会失败——这时辰千万不能当成”可疑”处置,不然搜索引擎会被整批误封。要分辨”的确没有反查纪录”和”我们这边解析不了”,后者应该跳过判断而不是封禁。
中幼企业怎么自查:三件不必要技术的事
上面那些是技术细节,大部门公司不用自己实现。但下面三件事你必须知路怎么查,由于问题往往就出在你以为不会出问题的处所。
- 去站长平台看”抓取异常”。这是最直接的证据。百度、Bing 的站长后盾都有抓取失败率和谬误明细,若是忽然出现大量抓取失败、衔接超时、被回绝接见,根基就是被自己的防护挡了。正常状态应该是靠近 0。
- 把所有”会拦人”的器材列一遍。好多公司的防护是好几层叠加的:CDN 有一层、服务器防火墙有一层、网站安全插件又有一层,可能还有一层是建站公司昔时配的、此刻没人知路。清单化,搞明显每一层都在拦什么。
- 确认封禁肯定带过期功夫。这是我们自己的硬端正:绝不做永远封禁。由于规定总有误判的一天,带过期功夫的封禁最多影响几幼时,永远封禁则会一向伤下去、并且没人记切昔时封过谁。
上线任何拦截规定,都先”只看不拦”
这是本文最想说的一条,也是唯一救了qy千亿一条:新的拦截规定先跑观察模式——只纪录”正本会拦谁”,不真的拦。跑几天,把名单翻一遍,确认里面没有你其实想请进来的客人,再正式开启。
这一步多花几天,但省掉的是”排名莫名下滑三个月还找不到原因”。我们那 4 个 Googlebot 就是这么捞回来的。安全和 SEO 的弃取,不该靠猜,该靠先看真实数据。
每月极度钟自查表
| 查什么 | 在哪查 | 正常应该是 |
|---|---|---|
| 抓取异常率 | 百度 / Bing 站长平台 → 抓取诊断、抓取异常 | 失败率靠近 0,无”回绝接见”类谬误 |
| 拦截层清单 | CDN 后盾 + 服务器防火墙 + 网站安全插件 | 每一层都说得清在拦什么,没有来历不明的规定 |
| 封禁名单 | 防护后盾的黑名单 / 已封 IP 列表 | 都有过期功夫;没有搜索引擎的 IP 在里面 |
| robots 文件 | 打开 域名/robots.txt |
没有误禁正式页面,没有 Disallow: / |
| 收录趋向 | site:域名 记总数 / 站长平台曲线 |
随发文缓慢上涨,不是从某月起掉头往下 |
和上一篇讲”静默失效”时一样,沉点是纪录不是查抄:每月记一笔,趋向才看得出来。爬虫被误封的中伤是渐进的,单看一天始终看不出问题。
几个常见疑难
Q:那我索性不做防护,全放进来行不能?
A:不能。扫描器是真的在找你的缝隙,不论会让服务器变慢,严沉的会直接导致数据泄漏或者被入侵。正确的方向不是”要不要防”,而是”用对的判据防”——按行为特点(好比上面说的找不到比例)判断,而不是单一按频率一刀切。
Q:被误封的爬虫,解封后能复原吗?
A:能,但要功夫。搜索引擎发现你这边反复接见失败,会自动降低抓取频率,复原到原来的节拍通常要几周。所以早发现比会补救沉要得多,这也是为什么要每月看抓取异常率。
Q:AI 的爬虫也要思考吗?
A:要,并且此刻越来越沉要。AI 要能引用你的内容,前提是抓得到。你把它挡在门表,了局就是在 AI 的回覆里彻底不存在——比搜索排名靠后严沉得多,由于 AI 何处没有”第二页”给你。
Q:怎么知路自己有几层防护?
A:问一句”我们网站前面挂了什么”通常问不清。比力靠得住的法子是把域名解析链路和服务器配置一路捋一遍,看流量到底经过了哪些环节。这件事一次性捋明显,画个图存着,以来排查任何接见问题都用得上。
不安自己的防护正把搜索引擎和 AI 挡在门表?
qy千亿力得为北京及周边中幼企业做网络安全防护与官网 SEO/GEO 运营——两件事我们一路做,所以明显它们会在哪儿打架:助你捋清有几层拦截、逐层查对规定、把爬虫误封解开并加上正反解验证的白名单,再按月盯抓取异常与收录趋向。文中那 4 个差点被封的 Googlebot,就是我们自己站上”先观察再开启”抓出来的。接见 siwenlide.com 或拨 400-686-2011 聊聊。





