当搜索引擎的爬虫访问一个网站时,它首先会查找根目录下的 robots.txt 文件。这份简单的文本文件如同给爬虫的一份访问须知,清晰划定了允许抓取和禁止触碰的范围。合理利用这份文件,不仅能让后台页面和敏感信息远离搜索结果,还能引导爬虫将抓取精力聚焦于网站的核心内容,从而为 SEO 效果带来正向作用。
robots.txt 文件必须存放在站点根目录下,标准访问路径为 https://yourdomain.com/robots.txt。文件名与目录对大小写敏感,且推荐使用 UTF-8 编码保存,避免中文注释出现乱码。每条指令需独占一行,行尾不能残留多余空格。在动手编写前,先把握以下几个核心字段的用法:
除了上述项目,还可以通过 Sitemap 行指明站点地图的存放位置。下面是常见配置组合示例:
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://yourdomain.com/sitemap.xml
这段规则的含义为:全站默认允许抓取,但 /admin/ 整个目录不开放,其中 /admin/public/ 作为特例被放行。值得警惕的是,对于那些不识别 Allow 指令的爬虫,它们只会执行 Disallow 的限制,此时 /admin/public/ 仍然被视作不可访问区域。
不同网站对抓取控制的需求各有差异,robots.txt 的编写方式也因此灵活多变。下面列出覆盖大多数场景的三种模板,可自行替换目录路径后直接套用。
内容输出型站点或新上线的网站,通常希望所有页面均能被搜索引擎发现。此时仅需添加一条规则:
User-agent: *
Disallow:
实际上,直接删去 Disallow 这一行,搜索引擎同样会抓取整站。而最需防范的是误写成 Disallow: /,一旦如此,爬虫将被全面阻拦,收录进程立即停滞。配置完成后,建议使用站长平台自带的抓取测试功能,确认规则输出的预期结果。
如果不想某个搜索引擎收录站点内容,可针对该爬虫单独配写规则:
User-agent: Bingbot
Disallow: /
这样设置后,其他搜索引擎的抓取动作不会受到干扰。关键在于爬虫名称必须准确无误,不同搜索引擎的爬虫命名各不相同,比如 Googlebot、Baiduspider 和 Sogou 蜘蛛,写错名称会导致规则失效。编写前最好前往各搜索引擎的官方说明文档核对名称拼写。
部分企业站点需要将后台功能页对爬虫隐藏,仅保留后台中少量展示页面供外部访问。这时可采用如下规则:
User-agent: *
Disallow: /
Allow: /backend/login
Allow: /backend/status
这种方案要求 Allow 指令的路径前缀与需要开放的内容完全匹配。需要注意的是,以 Disallow: / 开头再配合 Allow 使用的写法,主要是针对 Googlebot 这类支持白名单放行的爬虫,其他爬虫可能只看到"全站封禁"这一条信息,因此使用此结构前务必确认目标爬虫的兼容性。
在编写 robots.txt 时,不少人容易陷入一些隐蔽的误区,稍不留神就会让规则效果与预期背道而驰。下面这些高频陷阱值得特别关注。
同时,建议不要将站点地址或后台路径以纯文本形式写在 robots.txt 外的其他隐私文件中,因为这些文件本身也可能被爬虫收集,所有规则都应集中在 robots.txt 中进行统一管理。
robots.txt 并非一劳永逸,站点结构调整、目录更名或新增功能模块时,记得同步更新规则。每次修改后,可借助日志分析爬虫抓取请求的变化,判断是否出现抓取量异常升高或降低的情况。如果发现某个重要页面总是在搜索结果中缺席,首先要回查 robots.txt 的配置,排查是否存在路径冲突或误封。
另外,站长工具有时会提供 robots.txt 的测试页面,可以在线预览搜索引擎读取到文件后所理解的规则内容。利用这种反馈,可以有效确认写出的规则是否真正传达了自己想要的效果,避免上线后才发现问题。
不能。robots.txt 只是阻止爬虫抓取页面,但如果有其他网站主动链接到该页面,搜索引擎仍有可能依据外部信号将其展示在结果中。若需要彻底屏蔽某页面出现在搜索结果,应同时配合使用 noindex 标签。
生效时间并不固定。爬虫会在再次访问站点时重新读取该文件,有的搜索引擎会在几小时内完成刷新,有的则可能需要数天,具体取决于爬虫的抓取频率与站点的更新权重。
并不一致。Googlebot 明确支持 Allow 与通配符,而部分其他搜索引擎的爬虫可能只解析 User-agent 与 Disallow 两项,对 Allow 不加识别。因此当规则需要精确控制某个子目录时,最好在使用前查阅目标搜索引擎的官方规范。
robots.txt 规则虽简,但每个细节都可能在搜索引擎的抓取行为上掀起波澜。建议从最简单的全站放行开始,逐步增加目录限制,并结合站长工具的测试功能逐步验证每条规则的实际效果。切忌一次性堆砌大量模棱两可的规则,否则一旦路径冲突,排错将耗费不少时间。保持文件干净、意图明确,才是确保爬虫高效工作的关键。