如何建自己的博客怎样核对抓取限制

📍 WDQWDWQD987AAAAA:216.73.216.141
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /ca7ba2acd0c2.html
📄

如何建自己的博客怎样核对抓取限制

核对抓取限制,核心是确认搜索引擎到底能不能抓到你博客的页面。做法分三步:先看 robots.txt 是否允许抓取,再看页面本身有没有 noindex 或登录墙,最后用抓取工具或服务器日志验证真实结果。第一次接触时,建议从 robots.txt 和单篇测试页开始,不要一上来就翻整站配置。

先分清三种限制来自哪里

抓取限制不是一个开关,而是多个环节叠加的结果。核对前先分清来源,判断才不会跑偏。

这三类现象可能同时存在。看到页面没被收录时,不要直接断定是 robots.txt 的问题,需要逐层排除。

逐步核对 robots.txt 的写法

robots.txt 放在博客根目录,例如 https://你的域名/robots.txt。核对时按下面顺序做:

  1. 打开该文件,确认没有整站封禁,比如 Disallow: / 单独出现在 User-agent: * 下。
  2. 检查是否误封了文章目录,例如 Disallow: /posts/,这会让所有文章无法被抓取。
  3. 确认没有把 CSS、JS 目录一并封禁,否则页面渲染可能不完整。
  4. 检查是否写了 Sitemap: 行,方便爬虫发现文章地址。

适用条件是:你拥有站点文件编辑权限,且限制来自站点配置。判断结果是——如果规则里存在整站或文章目录的 Disallow,就是已定位的原因;如果没有,则继续查页面级限制。

检查页面级 noindex 与访问状态

打开一篇想被收录的文章,查看网页源代码,搜索 noindex。如果模板或插件自动给所有页面加了 noindex,文章再多也不会进入索引。

接着看访问状态。可以用命令行确认:

curl -I https://你的域名/一篇文章地址

重点看返回码:200 表示正常;301 或 302 表示跳转,需确认最终地址;403、429 表示被拦截或限流;503 表示服务暂时不可用。这些只是可能原因,只有结合服务器日志才能确认是哪一种。

验收信号是:目标文章返回 200,源码中没有 noindex,且没有被登录或验证码挡住。

用抓取工具和日志做最终验证

配置改完后,不要凭感觉判断。可以提交单篇文章地址做抓取测试,观察返回的是成功、被 robots.txt 阻止,还是被标记为 noindex。若博客已接入搜索平台的站长工具,抓取统计和覆盖率报告能反映实际抓取情况。

服务器日志是更直接的证据。搜索爬虫的 User-Agent,看它请求了哪些地址、返回了什么状态码。如果日志里根本没有目标文章,说明链接发现环节有问题;如果频繁出现 403 或 429,说明访问级限制在起作用。

比较改动效果时要注意:搜索需求会随季节波动,数据采集也可能有延迟,不能只看一两天的收录数量就下结论。

第一次操作的下一步

先选一篇已经发布、内容完整的文章作为测试对象,按“robots.txt → 页面源码 → 返回码 → 抓取测试”的顺序走一遍,记录每一步的结果。确认单篇能正常被抓取后,再检查全站模板是否对所有文章施加了同样的限制。

图1 图2

nginx