Robots.txt是放在网站根目录的纯文本文件,用于告知搜索引擎爬虫哪些页面可以抓取,哪些需要跳过。合理设置能保护后台等敏感区域,同时让抓取预算集中在关键内容上;但配置失误,可能造成页面长时间不被收录,甚至导致整站被搜索引擎移除。下面从文件语法、常见场景写法以及高频误区三个层面,提供可直接落地的配置参考。
文件名称必须严格为robots.txt,且需放置在域名根目录。文件内容为纯文本,每行遵循“字段名: 值”的格式,字段名与值之间用英文冒号加空格分隔。
主要字段包括User-agent、Disallow、Allow与Sitemap。User-agent指定规则针对的爬虫,星号代表所有爬虫。最基本的全站放行配置如下:
User-agent: *
Disallow:
该配置表示允许所有爬虫抓取整站。需注意:字段名区分大小写;路径必须以“/”开头;推荐使用UTF-8无BOM编码,以防解析异常。井号可用于注释,但不同爬虫对注释的识别有不一致,核心规则不要依赖注释。
开始配置前,先梳理网站目录结构,明确需要保护与需要重点抓取的路径。以下是四种常见场景的标准写法。
每个规则组之间建议用空行隔开,便于阅读与后期维护。
以下错误在网站运维中较为普遍,且造成的负面影响往往不易察觉。
配置文件修改后不会立即生效。搜索引擎爬虫通常会缓存文件,短则数小时,长则数天。建议在修改后用各搜索平台提供的robots测试工具进行验证,检查语法是否合法以及屏蔽范围是否准确。
另外,若网站改版导致目录结构变化,务必同步更新robots.txt;删除或迁移旧路径时,也要检查文件是否仍包含过时的Disallow规则。定期审阅文件内容,能避免因长期未更新而产生的意外屏蔽问题。
不能。robots.txt只是协商请求,不具强制性。爬虫通常遵守指令,但若页面已被其他外部链接指向,仍可能被编入索引。若要彻底防止收录,应配合使用noindex标签。
文件路径中不建议出现中文及特殊字符。若路径包含非ASCII字符,应使用URL编码形式(如%20代表空格),避免爬虫解析失败。
生效时间取决于各爬虫的抓取频率。百度、谷歌等主流搜索引擎一般会在数小时内重新抓取robots文件,但在流量较低或抓取频率受限的情况下,可能需要两至三天。
Robots.txt配置虽不复杂,但细节决定成败。建议从明确目录结构入手,每一条规则都遵循“路径首尾加斜杠”的原则,配置后及时用工具验证,并养成定期复查的习惯。同时把robots.txt与sitemap文件配合使用,能更高效地引导爬虫抓取重点内容,为网站带来更稳定的搜索收录表现。