robots.txt是运行在网站根目录里的一个纯文本文件,它的核心职责是向搜索引擎爬虫说明站点内部的访问规则,比如哪些路径可以抓取,哪些路径应该避开。对于站点运营者来说,这是控制爬虫抓取行为、防止后台目录或隐私数据被收录的基础手段。配置合理,爬虫就能把精力放在核心内容上;配置疏忽,则可能带来不必要的收录风险。
一份可用的robots.txt由若干指令块组成,每个指令块里通常包含下面几个关键字段:
一个常见的参考写法如下:
User-agent: *
Disallow: /tmp/
Allow: /tmp/public/
Sitemap: https://www.example.com/sitemap.xml
书写时需要注意两点:路径名称区分大小写,所有符号必须使用半角格式。任何一行的标点或拼写错误,都可能导致整段规则被忽略。
根据网站的运营阶段和内容特点,robots.txt的具体写法应当灵活调整。这里整理了几种常见场景下的配置思路。
新站调试阶段或站点需要临时维护时,可以禁止所有爬虫访问全部路径。不过要明确一点,这个操作并不会删除搜索引擎已有的收录快照,如果希望彻底移除旧内容,还需要结合站长平台提供的索引删除工具来处理。
User-agent: *
Disallow: /
如果网站内容全部公开,没有需要隐藏的文件,可以不添加任何Disallow规则,只需声明Sitemap地址即可。这种配置最简洁,也有利于爬虫完整遍历整个站点。
User-agent: *
Allow: /
Sitemap: https://www.example.com/sitemap.xml
企业站和内容站通常需要隐藏后台登录入口、用户中心或临时生成目录,避免它们被搜索引擎见诸于众。常见的写法是把这些路径逐一列出。
User-agent: *
Disallow: /admin/
Disallow: /account/
Disallow: /cache/
这样做能明显降低后台地址被收录的概率,从而减少针对性的恶意探测行为。
如果希望主流搜索引擎正常收录,同时屏蔽其他不受欢迎的爬虫,可以为不同爬虫分别配置独立的指令块。注意不同指令块之间需要留有空白行区分。
User-agent: *
Disallow:
User-agent: BadBot
Disallow: /
在配置robots.txt时,不少站点会因细节疏忽而踩坑。以下几点值得特别留意:
每次修改robots.txt之后,建议通过搜索引擎的抓取测试工具来验证书写是否正确,确认没有阻挡核心页面的抓取。日常运维中,可以定期检查网站日志,观察各类爬虫的实际访问行为,若发现异常抓取频率,再针对性调整规则。同时,改版时不要忘记同步更新Sitemap地址,保持两者内容一致性。
会。如果误屏蔽了首页或主要栏目路径,搜索引擎将无法抓取这些页面,排名自然也会受到明显影响。因此在改动后,务必借助测试工具核实规则效果。
一般情况下Allow优先生效。这常用于先屏蔽某个目录,再单独放行其中个别文件的场景。但不同搜索引擎对匹配逻辑的细节处理略有差异,建议尽量保持规则简单清晰。
爬虫会定期重新抓取robots.txt文件,通常需要数小时到数天不等。如果希望加快生效速度,可以尝试在搜索引擎的搜索资源平台中手动提交更新请求。
robots.txt配置的核心在于理解语法边界和优先规则,结合网站实际情况设定合理的抓取范围。上线前建议先在测试环境验证规则,避免误伤正常页面;上线后也要定期审视配置,确保它始终与站点结构保持一致。只要抓住"开放核心、屏蔽敏感"这一原则,多数站点都能借助这一工具获得理想的抓取效果。