Robots.txt是存放在网站根目录的纯文本文件,用于告知搜索引擎爬虫哪些页面可以抓取、哪些需要回避。合理配置既能保护后台等敏感区域,也能让抓取资源集中在重要页面;但配置失误可能造成页面迟迟不被收录,甚至整站被搜索引擎移除。下面从语法基础、场景写法和常见问题三个方面展开说明。
文件必须命名为robots.txt(全部小写),并放置在网站域名的根目录下。内容为纯文本格式,每条规则由字段名和值构成,字段名与值之间用英文冒号加空格分隔。
主要字段包括User-agent、Disallow、Allow和Sitemap。User-agent指定规则适用的爬虫,星号代表所有爬虫。最简单的全站放行配置如下:
User-agent: *
Disallow:
这段内容表示允许所有爬虫访问全站。字段名区分大小写,路径必须以斜杠开头,推荐使用UTF-8无BOM编码,避免解析异常。注释以井号开头,但不同爬虫对注释的兼容性不一,核心规则不建议依赖注释。
配置前先梳理站点目录结构,明确哪些路径需要保护、哪些需要重点抓取。以下列举四种常见场景的写法。
每条规则组之间建议留一个空行分隔,便于阅读和后续维护。
以下几类错误在实际运维中最常见,且后果往往不易察觉。
配置完成后,可通过浏览器访问域名/robots.txt查看文件是否正常显示,并留意是否出现编码乱码或格式错乱。
写完robots.txt并非一劳永逸,需定期检查其有效性。可借助搜索引擎提供的抓取诊断工具或第三方测试页面,模拟爬虫抓取并查看规则匹配结果。重点关注新上线页面是否被意外屏蔽,以及改版后目录结构变化是否影响原有规则。
建议建立版本管理,每次修改记录时间与原因。若站点规模较大,可考虑将robots.txt与其他爬虫管理手段(如meta标签、规范化URL)配合使用,形成多层防护。
如果错误地写成Disallow: /,搜索引擎会停止抓取全站页面,但已收录的页面不会立即被删除,可能在一段时间后逐渐被移除。发现后及时修正并提交验证即可恢复。
整体语法大同小异,但通配符支持、字段大小写敏感度等细节存在差异。例如Google完全兼容*和$,而个别爬虫可能忽略这些符号。配置时建议以目标搜索引擎的官方文档为准。
不能。Robots.txt只控制抓取行为,不控制索引。如果页面被其他外部链接指向,搜索引擎仍可能将其编入索引,只是不会抓取页面内容。若要彻底阻止收录,需使用meta robots标签或X-Robots-Tag响应头。
配置robots.txt时,建议从最小化限制开始,先明确需要屏蔽的路径,再逐条添加规则。养成路径带斜杠、规则组空行分隔的习惯,并定期用模拟抓取工具验证效果。遇到不确定的规则,宁可少写也不要误伤整站抓取。合理的配置既能保护隐私,又能让抓取资源用在刀刃上,为SEO打好基础。