robots.txt是部署在站点根目录的纯文本文件,通过指令告知搜索引擎爬虫哪些路径可以抓取、哪些路径应当略过。它不具备安全防护功能,但对提升抓取效率、保护后台目录以及降低服务器负荷而言,是站点管理者必须掌握的基础配置。
掌握robots.txt的关键在于理解几条基础指令的组合方式,理清匹配逻辑后,日常配置便游刃有余。
常见误区:每组User-agent声明后必须至少包含一条Disallow或Allow规则,否则整组失效。此外,该文件仅对合规爬虫生效,用户通过浏览器访问依旧畅通,敏感信息绝不能仅依赖此文件保护。
无论站点规模如何,首版建议从稳妥的基础配置起步,下面模板可直接套用并调整。
User-agent: *
Disallow: /cgi-bin/
Disallow: /temp/
Sitemap: https://www.yourdomain.com/sitemap.xml
验证与避坑:部署后访问"站内域名/robots.txt",能看到文件内容即为成功。新手常见的失误是误写Disallow: /,这会导致整站被拒绝索引。路径末端的斜杠同样关键,比如Disallow: /temp无法拦截/temp/目录。
随着站点目录持续扩展,单一的放行或屏蔽策略略显捉紧,Allow指令的优势在此凸显。典型场景是:全量屏蔽图片素材库,但希望其中某张品牌主图被收录。
User-agent: *
Disallow: /assets/pics/
Allow: /assets/pics/brand.png
执行要点:同一组内路径匹配长度更长的规则优先,因此上述配置中brand.png的放行规则会覆盖其所在目录的屏蔽规则。建议在屏蔽范围扩大时,同步检查是否有需要优先生效的例外文件。
配置完成后并非一劳永逸,定期检查能帮助站点维持良好的收录状态。
调试思路:借助搜索引擎站长平台的抓取测试工具,输入需验证的URL,观察是否被该规则允许或拒绝。若规则表现异常,优先排查部分目录权限与文件编码。
不能。该文件仅约束配合合规的搜索引擎爬虫,用户直接输入URL或通过外部链接访问均不受限制,隐私数据需结合登录验证或服务器权限管理。
每个分组针对其声明的爬虫独立生效。若同一条规则需适配全部蜘蛛,可统一使用User-agent: *,并确保该分组内至少有一条Disallow或Allow指令。
生效时间取决于搜索引擎的抓取频率,一般在数小时至数天不等。如需加快验证,可使用站长平台的更新提交功能,通常能在更短时间内获取最新版本。
robots.txt配置虽不复杂,但细节决定成败。建议按以下顺序推进:首版采用保守策略,仅屏蔽无价值目录;规则变更后及时用抓取工具验证;定期复查文件内容,确保路径与站点结构调整同步。